Límites de servicio en Búsqueda de Azure AI

Nota:

Búsqueda de Azure AI está disponible a través del portal de Azure, las API REST y los SDK de Azure. También respalda Foundry IQ, la capa de conocimiento administrada que transforma el contenido empresarial en bases de conocimiento reutilizables y compatibles con permisos para agentes en el portal de Microsoft Foundry.

Los límites máximos de almacenamiento, cargas de trabajo y cantidades de índices y otros objetos dependen del modelo de precios del servicio de Búsqueda de Azure AI.

Búsqueda de Azure AI admite dos modelos de precios, cada uno con los niveles de servicio asociados. El nivel seleccionado afecta a los límites de servicio descritos en esta guía.

  • Dedicado: Precios fijos medidos por unidades de búsqueda (SU). Las opciones de nivel de servicio incluyen: Básico, Estándar (S1-S3, incluido S3 HD), Optimizado para almacenamiento (L1-L2) y un nivel Gratis con funcionalidades limitadas del servicio de búsqueda.
  • Sin servidor (versión preliminar): precios basados en el consumo medidos por unidades de proceso por hora (CU/hr) y por GB/mes para el almacenamiento indexado. El nivel de versión preliminar actual es: Desarrollador sin servidor. Los límites se definen mediante topes por índice, número de objetos por servicio y el comportamiento de limitación sin servidor.

Importante

El nivel Desarrollador sin servidor está actualmente en versión preliminar. Esta versión preliminar se ofrece sin contrato de nivel de servicio y no es aconsejable usarla en las cargas de trabajo de producción. Es posible que algunas características no se admitan o que tengan funcionalidades restringidas. Para más información, consulte Términos de uso complementarios para las versiones preliminares de Microsoft Azure.

La facturación del nivel Desarrollador sin servidor comienza el 13 de septiembre de 2026. Los cargos por el uso en o después de esa fecha aparecen en la factura de Azure. No se le cobrará por el uso antes del 13 de septiembre de 2026. El plan Desarrollador sin servidor es un plan de pago una vez que comienza la facturación. El nivel Desarrollador sin servidor no admite la migración a ni desde otros planes de tarifa y algunas características disponibles en otros niveles no se admiten durante la versión preliminar pública. Los límites de servicio, las características admitidas y los detalles de precios pueden cambiar antes de la disponibilidad general.

Durante la versión preliminar, el modelo de precios sin servidor solo se admite en regiones específicas.

Para más información, consulte Elección de un modelo de precios y un nivel de servicio.

Diagnóstico de errores de cuota, capacidad o límite

Los errores de cuota y capacidad se deben a controles distintos. Utiliza el error de la operación completada para determinar cuál de ellos se aplica.

Si todavía se está ejecutando una operación de creación, escala o actualización, espere a que el estado de aprovisionamiento se convierta Succeeded en o Failed. Una operación en curso no es evidencia de un problema de cuota o capacidad. Si se produce un error en una operación de escalado, consulte Errores durante el escalado.

Failure Causa probable Primera acción
Creación de servicios bloqueada en una suscripción y una región Cuota de suscripción En el servicio Cuotas , compruebe el límite del nivel y la región y, a continuación, solicite más servicios.
La creación, el escalado o la actualización fallan aunque haya cuota disponible Restricción de capacidad regional Compruebe las notas al pie sobre los niveles restringidos en la disponibilidad por región y, a continuación, elija otra región.
Rechazo de una solicitud de réplica, partición, nivel o objeto Límite del servicio o del índice Compare su configuración y el recuento de objetos con los límites del servicio y los límites del índice.
El servicio de búsqueda devuelve respuestas de limitación de tráfico bajo carga Throttling Reduzca la tasa de solicitudes o agregue unidades de búsqueda. Consulte Límites de limitación de velocidad.
Se produce un error en la indexación cerca de un límite de almacenamiento o vector Cuota de almacenamiento o de vectores Compara storageSize con el almacenamiento de la partición para el disco y vectorIndexSize con los límites de tamaño del índice de vectores para la memoria.
El indexador, la habilidad o el vectorizador devuelven un error 429 procedente de otro servicio Azure OpenAI u otra cuota de servicio Siga las instrucciones de cuota para el servicio que emitió el error, como Azure OpenAI.

La cuota de suscripción disponible no garantiza la capacidad regional y la solicitud de más cuota no resuelve una restricción de capacidad. Si el error persiste, abra una solicitud de Soporte técnico de Azure que incluya la suscripción, la región, el nivel, la configuración solicitada, el texto de error completo, la hora UTC y cualquier identificador de correlación o operación.

Límites de suscripción

Puede crear varios servicios de búsqueda facturables (Básico y avanzado), hasta el número máximo de servicios permitidos en cada nivel por región. Por ejemplo, puede crear hasta 16 servicios en el nivel Básico y otros 16 servicios en el nivel S1 dentro de la misma suscripción y región. Después, puede crear 16 servicios básicos adicionales en otra región para un total combinado de 32 servicios básicos en la misma suscripción. Para obtener más información sobre los niveles de servicio, consulte Elegir un modelo de precios y un nivel de servicio.

Puede aumentar los límites máximos de servicio por solicitud. Si necesita tener más servicios en la misma suscripción, envíe una solicitud de soporte técnico.

Recurso Gratis 1 Básico S1 S2 S3 S3 HD L1 L2 Desarrollador sin servidor
Máximo de servicios por región 1 16 16 8 6 6 6 6 5
Número máximo de unidades de búsqueda (SU)2 N/D 3 unidades de búsqueda 36 unidades de búsqueda 36 unidades de búsqueda 36 unidades de búsqueda 36 unidades de búsqueda 36 unidades de búsqueda 36 unidades de búsqueda N/D

1 Puede tener un servicio de búsqueda gratuito por suscripción de Azure. El nivel gratuito se basa en la infraestructura compartida con otros clientes. Dado que el hardware no está dedicado, no se admite el escalado vertical y el almacenamiento está limitado a 50 MB. Es posible que se elimine un servicio de búsqueda gratuito después de largos períodos de inactividad para que haya espacio para más servicios.

2 Las unidades de búsqueda (SU) son unidades facturables, asignadas como réplica o como partición. Necesitas ambos. Para obtener más información sobre las combinaciones de SU, consulte Estimación y administración de la capacidad de un servicio de búsqueda.

Límites de servicio

En el modelo de precios dedicado, planee la capacidad multiplicando las réplicas por particiones (unidades de búsqueda).

Recurso Gratuito Básico S1 S2 S3 S3 HD L1 L2 Desarrollador sin servidor
Particiones N/D 3 1 12 12 12 3 12 12 N/D
Réplicas N/D 3 12 12 12 12 12 12 N/D

1 El nivel Básico admite tres particiones y tres réplicas, para un total de nueve unidades de búsqueda (SU) en los nuevos servicios de búsqueda creados después del 3 de abril de 2024. Los servicios Basic antiguos se limitan a una partición y tres réplicas.

Un servicio de búsqueda está sujeto a un límite máximo de almacenamiento (tamaño de partición multiplicado por el número de particiones) o un límite máximo en el número máximo de índices o indizadores, el límite que ocurra primero.

Los acuerdos de nivel de servicio (SLA) se aplican a los servicios facturables que tienen dos o más réplicas para cargas de trabajo de consulta, o tres o más réplicas para cargas de trabajo de consulta e indexación. El número de particiones no se tiene en cuenta en el contrato de nivel de servicio. Para más información, consulte Confiabilidad en Búsqueda de Azure AI.

Los servicios gratuitos no tienen particiones ni réplicas fijas y comparten recursos con otros suscriptores.

Almacenamiento de particiones (GB)

Los límites de almacenamiento por servicio varían en función de dos factores: fecha de creación y región del servicio. La mayoría de las regiones admitidas ofrecen límites más altos para los servicios más recientes.

En esta tabla se muestra la progresión de los aumentos de cuota de almacenamiento en GB a lo largo del tiempo. A partir de abril de 2024, las particiones de mayor capacidad entraron en funcionamiento en las regiones indicadas en las notas al pie. Si tiene un servicio anterior en una región admitida, compruebe si puede actualizar el servicio para obtener mayores límites de almacenamiento.

Fecha de creación del servicio Básico S1 S2 S3/HD L1 L2 Desarrollador sin servidor
Antes del 3 de abril de 2024 2 25 100 200 1024 2 048 N/D
3 de abril de 2024 hasta el 17 de mayo de 2024 1 15 160 512 1,024 1024 2 048 N/D
Después del 17 de mayo de 2024 2 15 160 512 1024 2,048 4,096 N/D
Después del 10 de febrero de 2025 3 15 160 512 1024 2 048 4 096 N/D

1 Almacenamiento de capacidad superior para Basic, S1, S2 y S3 en estas regiones. Américas: Brasil Sur, Centro de Canadá, Este de Canadá, Este de EE. UU., Este de EE. UU. 2, Centro de EE. UU., Centro Norte de EE. UU., Sur Central de EE. UU., Oeste de EE. UU., Oeste de EE. UU. 2, Oeste de EE. UU. 3, Centro Oeste de EE. UU. Europa: Centro de Francia. Norte de Italia, Norte de Europa, Este de Noruega, Centro de Polonia, Norte de Suiza, Centro de Suecia. Sur de Reino Unido, Oeste de Reino Unido. Oriente Medio: Norte de Emiratos Árabes Unidos. África: Norte de Sudáfrica. Asia Pacífico: Este de Australia, Sureste de Australia, India Central, Jio India Oeste, Este de Asia, Sureste de Asia, Este de Japón, Oeste de Japón, Centro de Corea, Corea del Sur.

2 Almacenamiento de capacidad superior para L1 y L2. Más regiones proporcionan mayor capacidad en cada nivel facturable. Américas: Este de EE. UU. 2 EUAP. Europa: Norte de Alemania, Centro-oeste de Alemania y Oeste de Suiza. Azure Government: (Texas, Arizona y Virginia). Africa: Norte de Sudáfrica. Asia Pacífico: Norte de China 3, Este de China 3.

3 Hay disponible almacenamiento de capacidad superior en Oeste de Europa.

Importante

Actualmente, los límites de almacenamiento más altos no están disponibles en las siguientes regiones, que están sujetos a los límites anteriores al 3 de abril.

  • Centro de Israel
  • Centro de Qatar
  • Centro de España
  • Sur de la India

Límites de índice

Recurso Gratuito Básico 1 S1 S2 S3 S3 HD L1 L2 Desarrollador sin servidor
Índices máximos 3 5 o 15 50 200 200 1000 GB por partición o 3000 por servicio 10 10 30
Campos simples máximos por índice 2 1 000 100 1 000 1 000 1 000 1 000 1 000 1 000 1 000
Dimensiones máximas por campo de vector 4096 4096 4096 4096 4096 4096 4096 4096 4096
Colecciones complejas máximas por índice 40 40 40 40 40 40 40 40 40
Elementos máximos en todas las colecciones complejas por documento 3 3000 3000 3000 3000 3000 3000 3000 3000 3000
Profundidad máxima de campos complejos 10 10 10 10 10 10 10 10 10
Número máximo de sugeridores por índice 1 1 1 1 1 1 1 1 1
Perfiles de puntuación máximo por índice 100 100 100 100 100 100 100 100 100
Configuraciones semánticas máximas por índice 100 100 100 100 100 100 100 100 100
Funciones máximas por perfil 8 8 8 8 8 8 8 8 8
Tamaño máximo de índice 4 N/D N/D N/D 1,88 TB 2,34 TB 100 GB N/D N/D 1 GB

1 Los servicios básicos creados antes de diciembre de 2017 tienen límites inferiores (5 en lugar de 15) en los índices. El nivel básico es el único nivel con un límite inferior de 100 campos por índice.

2 El límite superior de los campos incluye campos de primer nivel y subcampos anidados en una colección compleja. Por ejemplo, si un índice contiene 15 campos y tiene dos colecciones complejas con 5 subcampos cada uno, el recuento de campos del índice es 25. Los índices que tengan una colección de campos muy grandes pueden ser lentos. Limite los campos y atributos a solo los que necesite y ejecute la indexación y la prueba de consulta para asegurarse de que el rendimiento sea aceptable.

3 Existe un límite superior para los elementos porque tener un gran número de ellos aumenta significativamente el almacenamiento necesario para el índice. Un elemento de una colección compleja se define como un miembro de esa colección. Por ejemplo, supongamos que un documento de hotel contiene una colección compleja llamada Rooms. Cada habitación de la colección Rooms se considera un elemento . Durante la indexación, el motor de indexación puede procesar de forma segura un máximo de 3000 elementos en todo el documento. Este límite se presentó en api-version=2019-05-06 y se aplica solo a colecciones complejas, no a colecciones de cadenas ni a campos complejos.

4 Para la mayoría de los niveles, el tamaño máximo del índice es el almacenamiento total disponible en el servicio de búsqueda. En el caso de los servicios S2, S3 y S3 HD con varias particiones y, por tanto, más almacenamiento, el tamaño máximo de un único índice se proporciona en la tabla. Se aplica a los servicios de búsqueda creados después del 3 de abril de 2024. Los índices de los servicios configurados con el modelo sin servidor (versión preliminar) tienen un tamaño máximo establecido proporcionado en la tabla.

Es posible que encuentre alguna variación en los límites máximos si el servicio casualmente se aprovisiona en un clúster más eficaz. Los límites aquí representan el denominador común. Los índices creados con las especificaciones anteriores se pueden transportar entre los niveles de servicio equivalentes de cualquier región.

Límites de documento

Cada índice admite hasta el siguiente número de documentos:

  • 24 mil millones en Básico, S1, S2 y S3
  • 2 mil millones en S3 HD
  • 288 mil millones en L1
  • 576 mil millones en L2

Cada documento puede tener un tamaño aproximado de 16 MB. El límite de tamaño del documento se aplica realmente al tamaño de la carga de la solicitud de api de indexación, que es de 16 MB. Esa carga puede ser un solo documento o un lote de documentos. Para un lote con un único documento, el tamaño máximo del documento es de 16 MB de JSON.

El límite de tamaño del documento se aplica a la indexación en modo push que carga documentos en un servicio de búsqueda. Si usa un indexador para la indexación en modo de extracción, los archivos de origen pueden tener cualquier tamaño de archivo, sujeto a los límites del indexador. En el caso del indexador de blobs, los límites de tamaño de archivo son mayores para los niveles superiores. Por ejemplo, el límite S1 es de 128 MB y el límite S2 es de 256 MB.

Al calcular el tamaño del documento, recuerde indexar solo los campos que agregan valor a los escenarios de búsqueda. Excluya los campos de origen que no tienen ningún propósito en las consultas que quiera ejecutar.

Límites de tamaño del índice vectorial

Al indexar documentos con campos vectoriales, la Búsqueda de Azure AI construye índices vectoriales internos mediante los parámetros de algoritmo que proporcione.

El tamaño de estos índices vectoriales está restringido por:

  • La memoria reservada para vector de búsqueda correspondiente al nivel de su servicio (o SKU) en el modelo de precios dedicado.
  • Límites de almacenamiento por índice en el modelo de precios sin servidor.

Para obtener instrucciones sobre cómo administrar y maximizar el almacenamiento de vectores, consulte Tamaño del índice vector y permanencia dentro de los límites.

Los límites de vectores varían según:

Desde abril de 2024, existen límites de vectores más elevados para los nuevos servicios de búsqueda en las regiones que proporcionan la capacidad adicional, que son la mayoría. Si tiene un servicio anterior en una región admitida, compruebe si puede actualizar el servicio a los límites de vectores más altos.

En el modelo de precios sin servidor, los límites de vectores se definen por índice en lugar de por partición.

  • Tamaño máximo del índice vectorial por índice (sin servidor): 300 MB
    • Este tamaño representa aproximadamente 30% del almacenamiento total de índices, coherente con la relación de vector a almacenamiento usada en los niveles de servicio dedicados.
    • Este tamaño es un límite estricto por índice. Los intentos de superar este límite durante la indexación fallan.

En esta tabla se muestra la progresión de los aumentos de la cuota de vectores en GB a lo largo del tiempo. La cuota es por partición, por lo que si escala un nuevo servicio Estándar (S1) a 6 particiones, la cuota de vectores total es 35 multiplicada por 6.

Fecha de creación del servicio Básico S1 S2 S3/HD L1 L2
Antes del 1 de julio de 20231 0,5 1 6 12 12 36
1 de julio de 2023 hasta el 3 de abril de 20242 1 3 12 36 12 36
3 de abril de 2024 hasta el 17 de mayo de 20243 5 35 150 300 12 36
Después del 17 de mayo de 20244 5 35 150 300 150 300

1 Límites de vectores iniciales durante la versión preliminar temprana.

2 Límites de vectores durante el período de versión preliminar posterior. Tres regiones no tenían los límites más altos: Centro-oeste de Alemania, India Occidental, Centro de Catar.

3 Cuota de vectores superior en función de las particiones más grandes para los niveles y regiones admitidos.

4 Cuota de vectores superior para más niveles y regiones en función de las actualizaciones de tamaño de partición.

El servicio aplica una cuota de tamaño de índice vectorial:

  • Dedicado: por cada partición de su servicio de búsqueda
  • Sin servidor: Por índice

Esta cuota es un límite estricto para garantizar que su servicio se mantenga en buen estado. Los intentos de indexación adicionales una vez que se supera el límite producen un error. Puede reanudar la indexación una vez que libere la cuota disponible mediante:

  • Eliminación de documentos vectoriales
  • Reducción del tamaño de vector o dimensionalidad
  • (Solo dedicado) Escalado horizontal de particiones

Importante

Los límites de vectores más altos están vinculados a tamaños de partición mayores. Actualmente, los límites de vectores más altos no están disponibles en las siguientes regiones, que están sujetas a los límites de julio a abril.

  • Centro de Israel
  • Centro de Qatar
  • Centro de España
  • Sur de la India

Límites de indexador

Los tiempos de ejecución máximos existen para proporcionar equilibrio y estabilidad al servicio como un todo, pero es posible que los conjuntos de datos más grandes necesiten más tiempo de indexación que el que permite el máximo. Si un trabajo de indexación no se puede completar en el tiempo máximo permitido, intente ejecutarlo en una programación. El programador realiza un seguimiento del estado de la indexación. Si un trabajo programado de indexación se interrumpe por cualquier motivo, el indizador puede reanudarlo donde se quedó en la siguiente ejecución programada.

Nota:

En el modelo de precios sin servidor, el comportamiento del indexador difiere de los servicios dedicados. La capacidad no se define mediante réplicas o particiones. En su lugar, los límites de objetos por servicio, los límites de almacenamiento por índice y la limitación de nivel de servicio rigen los límites de indexación. El tiempo de ejecución máximo por ejecución del indexador de desarrollador sin servidor es de dos horas.

Objeto indexador y límites de rendimiento

Recurso Gratis 1 Básico 2 S1 S2 S3 S3 HD 3 L1 L2 Desarrollador sin servidor
Número máximo de indexadores 3 5 o 15 50 200 200 N/D 10 10 30
Máximo número de orígenes de datos 3 5 o 15 50 200 200 N/D 10 10 30 por servicio
Conjuntos de habilidades máximos 4 3 5 o 15 50 200 200 N/D 10 10 30
Carga máxima de indexación por invocación 10 000 documentos Limitado solo por la cantidad máxima de documentos Limitado solo por la cantidad máxima de documentos Limitado solo por la cantidad máxima de documentos Limitado solo por la cantidad máxima de documentos N/D Sin límite Sin límite Limitado solo por la cantidad máxima de documentos
Programación mínima 5 minutos 5 minutos 5 minutos 5 minutos 5 minutos 5 minutos 5 minutos 5 minutos 5 minutos
Tiempo máximo de ejecución por ejecución del indexador 5 1-3 o 3-10 min 2 o 24 horas 2 o 24 horas 2 o 24 horas 2 o 24 horas 2 horas 2 o 24 horas 2 o 24 horas 2 horas
Tiempo de ejecución del indexador acumulativo por servicio 6 N/D N/D N/D N/D N/D 24 horas N/D N/D 24 horas

1 Los servicios gratuitos tienen un tiempo de ejecución máximo del indexador de 3 minutos para servicios de blob y de 1 minuto para todos los demás orígenes de datos. La invocación del indexador es una vez cada 180 segundos. Para la indexación de IA que utiliza Foundry Tools, los servicios gratuitos se limitan a 20 transacciones gratuitas por indexador al día, donde una transacción se define como un documento que pasa exitosamente a través del proceso de enriquecimiento. (Sugerencia: Puede restablecer un indexador para restablecer su recuento).

2 Los servicios básicos creados antes de diciembre de 2017 tienen límites inferiores (5 en lugar de 15) en los indexadores, los orígenes de datos y los conjuntos de aptitudes.

3 La compatibilidad con el indexador HD de S3 está en versión preliminar y requiere la versión de la 2025-11-01-preview API REST o posterior. Los indexadores S3 HD solo se ejecutan en el entorno de ejecución multiinquilino y no admiten recursos de vínculo privado compartidos. En la versión preliminar, la compatibilidad con el indexador S3 HD es más adecuada para cargas de trabajo pequeñas (con un tamaño de índice de aproximadamente 1 GB) sin conjuntos de aptitudes o con conjuntos de aptitudes mínimos. Para obtener guía sobre el comportamiento global, la supervisión y la planificación, consulte la ejecución del indexador en sin servidor y S3 HD.

4 Máximo de 30 habilidades por conjunto de habilidades.

5 Con respecto a la duración máxima de 2 o 24 horas para los indexadores: un máximo de 2 horas es el más común y es lo que debe planear. Hace referencia a los indexadores que se ejecutan en el entorno público, que descarga el procesamiento intensivo de cálculo y deja más recursos para las consultas. El límite de 24 horas se aplica si configura el indexador para que se ejecute en un entorno privado usando solo la infraestructura asignada al servicio de búsqueda. Algunos indizadores más antiguos no pueden ejecutarse en el entorno público y esos indexadores siempre tienen un intervalo de procesamiento de 24 horas. Si tiene indexadores no programados que se ejecutan continuamente durante 24 horas, se puede asumir que esos indexadores no se pudieron migrar a la infraestructura más reciente. Como regla general, para los trabajos de indexación que no pueden finalizar en dos horas, coloque el indexador en una programación de 5 minutos para que el indexador pueda continuar rápidamente donde se quedó. En el nivel Gratis, el tiempo de ejecución máximo de 3 a 10 minutos es para los indexadores con conjuntos de aptitudes.

6 En los servicios S3 HD y sin servidor, todos los indexadores comparten 24 horas de tiempo de ejecución acumulado por servicio en cada ventana UTC de 24 horas. Para obtener orientación sobre el comportamiento de las cuotas, la supervisión y la planificación, consulte la ejecución del indexador en serverless y S3 HD.

Límites de archivos de origen para indexadores similares a blobs

El procesamiento de archivos se produce en fases y cada fase tiene sus propios límites:

  1. Un conector de fuente de datos descarga un elemento de la fuente, con sujeción a los límites específicos del conector de la fuente.
  2. Búsqueda de Azure AI extrae el contenido del elemento, sujeto al tamaño máximo del archivo de origen y a los límites de caracteres extraídos en la tabla siguiente.
  3. Opcionalmente, un conjunto de habilidades envía ese contenido a servicios posteriores, donde el límite de datos de entrada de una habilidad individual puede ser inferior a la cantidad que extrae el indexador.

El tamaño máximo de archivo de origen y los límites de caracteres extraídos de la tabla siguiente se aplican a los indexadores de Azure Blob Storage, ADLS Gen2, SharePoint en Microsoft 365, OneLake y Azure Files. Para conocer los límites por aptitud, consulte el artículo de referencia de cada aptitud del conjunto de aptitudes.

Recurso Gratuito Básico S1 S2 S3 S3 HD L1 L2 Desarrollador sin servidor
Tamaño máximo de archivo de origen, MB 24 16 16 128 256 256 N/D 256 256 256
Caracteres máximos extraídos de un archivo de origen 134 256 000 512.000 4 mil 8 mil 16 mil N/D 4 mil 4 mil 16 mil

1 El número máximo de caracteres se basa en unidades de código Unicode, específicamente UTF-16.

2 Cuando se usa delimitedText el modo de análisis para archivos CSV, se aplica un límite de tamaño de búfer de 10 MB por fila de archivo.

3 Al usar delimitedText el modo de análisis para archivos CSV, no se aplica el límite de "tamaño máximo de contenido extraído".

4 Los indexadores de tipo blob incluyen el indexador de Azure Blob Storage (indexador de blobs), el indexador de ADLS Gen2, el indexador de SharePoint en Microsoft 365, el indexador de OneLake y el indexador de Azure Files. El origen de conocimiento del archivo de carga directa no usa un indexador y tiene límites independientes.

Los indexadores pueden acceder a otros recursos de Azure mediante puntos de conexión privados administrados con la API de recursos compartidos de Private Link. En esta sección se describen los límites asociados a esta funcionalidad.

Nota:

El nivel de desarrollador del modelo de precios sin servidor no admite vínculos privados compartidos ni el perímetro de seguridad de red (NSP) con orígenes de datos. Se admiten puntos de conexión privados y reglas de firewall de IP para una conexión privada a un servicio de nivel de desarrollador sin servidor.

Recurso Gratuito Básico S1 S2 S3 S3 HD L1 L2 Desarrollador sin servidor
Compatibilidad con indexador de puntos de conexión privados No No No
Compatibilidad con puntos de conexión privados para indexadores con un conjunto de aptitudes1 No No No No
Compatibilidad con puntos de conexión privados para habilidades con una habilidad de incrustación 2 No No No
Número máximo de puntos de conexión privados N/D 10 o 30 100 400 400 N/D 20 20 N/D
Máximo de tipos de recursos distintos 3 N/D 4 7 15 15 N/D 4 4 N/D

1 El análisis de imágenes y el enriquecimiento con IA consumen muchos recursos informáticos y una cantidad desproporcionada de la potencia de procesamiento disponible. Por este motivo, las conexiones privadas están deshabilitadas en niveles inferiores para garantizar el rendimiento y la estabilidad del propio servicio de búsqueda. En los servicios básicos, las conexiones privadas a un recurso de Microsoft Foundry no son compatibles para conservar la estabilidad del servicio. Para el nivel S1, asegúrese de que el servicio se creó con límites superiores después del 3 de abril de 2024. Los indexadores con más de 2 aptitudes de inserción de Azure OpenAI o inserciones replicaciones de Azure Vision se restringen de la ejecución en un entorno privado y las conexiones privadas no están disponibles.

2 Las conexiones privadas a un modelo de inserción se admiten en los servicios de búsqueda básico y S1 de alta capacidad creados después del 3 de abril de 2024, con los límites más altos para el almacenamiento y el procesamiento computacional.

3 El número de tipos de recursos distintos se calcula como el número de valores de groupId únicos utilizados en todos los recursos de vínculo privado compartidos para un servicio de búsqueda determinado, independientemente del estado del recurso.

Límites de sinónimos

El número máximo de mapas de sinónimos varía según el nivel de servicio. Cada regla puede tener hasta 20 expansiones, donde una expansión es un término equivalente. Por ejemplo, dado el término "gato", la asociación con "gatito", "felino" y "felis" (el género de gatos) cuenta como tres expansiones.

Recurso Gratuito Básico S1 S2 S3 S3 HD L1 L2 Desarrollador sin servidor
Asignaciones máximas de sinónimos 3 3 5 10 20 20 10 10 20 por servicio
Número máximo de reglas por mapa cinco mil 20000 20000 20000 20000 20000 20000 20000 20000

Límites de alias de índice

El número máximo de alias de índice varía según la fecha de creación del nivel y del servicio. En todos los niveles, si el servicio se creó después de octubre de 2022, el número máximo de alias es el doble del número máximo de índices permitidos. Si el servicio se creó antes de octubre de 2022, el límite es el número de índices permitidos.

Nota:

El nivel Desarrollador de modelos sin servidor no admite alias de índice.

Fecha de creación del servicio Gratuito Básico S1 S2 S3 S3 HD L1 L2 Desarrollador sin servidor
Antes de octubre de 2022 3 5 o 15 1 50 200 200 1000 GB por partición o 3000 por servicio 10 10 N/D
Después de octubre de 2022 6 30 100 400 400 2000 GB por partición o 6000 por servicio 20 20 N/D

1 Los servicios básicos creados antes de diciembre de 2017 tienen límites inferiores (5 en lugar de 15) en los índices.

Límites de recuperación agéntica

Una base de conocimiento especifica uno o varios orígenes de conocimiento y un esfuerzo de razonamiento de recuperación que controla el nivel de procesamiento del modelo de lenguaje grande (LLM) para la recuperación agente. Los límites varían según el plan de tarifa, la versión de API y el nivel de esfuerzo de razonamiento.

Recurso Gratuito Básico S1 S2 S3 S3 HD L1 L2 Desarrollador sin servidor
Máximo de orígenes de conocimiento por servicio 3 5 o 15 1 50 200 200 0 10 10 30
Bases de conocimiento máximas por servicio 3 5 o 15 1 50 200 200 0 10 10 30
Máximo de orígenes de conocimiento por base de conocimiento (minimal) 2 3 5 o 10 1 10 10 10 0 10 10 10
Máximo de orígenes de conocimiento por base de conocimiento (low) 3 3 3 3 3 0 3 3 3
Máximo de orígenes de conocimiento por base de conocimiento (medium) 3 5 5 5 5 0 5 5 5

1 Los servicios básicos creados antes del 3 de abril de 2024 tienen límites inferiores (5) sobre orígenes de conocimiento y bases de conocimiento.

Orígenes de conocimiento por base de conocimiento

Los límites de las fuentes de conocimiento por base de conocimiento dependen de la versión de la API utilizada para crear o actualizar la base de conocimiento. En 2026-05-01-preview y versiones posteriores, todos los esfuerzos de razonamiento de recuperación admiten los mismos límites de origen de conocimiento. Las versiones preliminares anteriores de la API tienen límites más bajos para los esfuerzos de razonamiento de low y medium.

Versión de API Esfuerzo de razonamiento para la recuperación de información Gratuito Básico S1 S2 S3 S3 HD L1 L2
2026-05-01-preview y versiones posteriores minimal, , low, medium 3 5 o 10 1 10 10 10 0 10 10
2026-05-01-preview, 2025-08-01-preview minimal 2 3 5 o 10 1 10 10 10 0 10 10
2026-05-01-preview, 2025-08-01-preview low 3 3 3 3 3 0 3 3
2026-05-01-preview, 2025-08-01-preview medium 3 5 5 5 5 0 5 5

2 En versiones anteriores de la API en versión preliminar, el minimal esfuerzo de razonamiento admite más orígenes de conocimiento que low o medium porque omite el planeamiento de consultas basado en LLM.

Límites de datos (enriquecimiento de inteligencia artificial)

Los límites de datos se aplican a una canalización de enriquecimiento de IA que usa Azure Language en Foundry Tools. La entrada máxima es de 50 000 caracteres, medida por String.Length, para la aptitud reconocimiento de entidades, la aptitud vinculación de entidades, la aptitud extracción de frases clave, la aptitud detección de idioma y la aptitud de detección de PII. La habilidad de sentimiento tiene un límite máximo de 5.000 caracteres.

Use la habilidad División de texto cuando necesite dividir textos más extensos antes del procesamiento posterior.

Estos límites se aplican a los modelos de precios dedicados y sin servidor.

Limitaciones

Los límites de limitación ayudan a garantizar la estabilidad del servicio mediante el control de la tasa de solicitudes de API.

En el modelo de precios dedicado, la limitación se basa en unidades de búsqueda (réplicas × particiones).

En el modelo de precios sin servidor, la limitación no se basa en las unidades de búsqueda. En su lugar, los límites de operación de nivel de servicio y el comportamiento general del consumo rigen el rendimiento. Los límites de uso y servicio administran la capacidad, no la configuración de réplicas y particiones.

Operación Dedicado (por unidad de búsqueda) Sin servidor (por servicio o por índice)
Índices de lista (GET /indexes) 3 solicitudes/s/SU 3 solicitudes por segundo
Obtener índice (GET /indexes/{index}) 10 solicitudes/s/SU 10 solicitudes por segundo
Crear índice (POST /indexes) 12 solicitudes/min/SU 12 solicitudes/min
Crear o actualizar el índice (PUT /indexes/{index}) 6 solicitudes/sec/SU 6 solicitudes por segundo
Eliminar índice (DELETE /indexes/{index}) 12 solicitudes/min/SU 12 solicitudes/min
Estadísticas del servicio (GET /servicestats) 4 solicitudes/sec/SU 4 solicitudes por segundo
Consultas de búsqueda (POST /indexes/{index}/docs/search) Varía según el número de SU y la complejidad de las consultas. 50 consultas por segundo (limitación de lectura agregada por índice)
Documentos de índice (POST /indexes/{index}/docs/index) Varía según el recuento de SU y la carga de trabajo de indexación. 5 solicitudes por segundo por índice
Sugerir (POST /indexes/{index}/docs/suggest) Varía según la cantidad de SU. No definido explícitamente
Autocompletado (POST /indexes/{index}/docs/autocomplete) Varía según la cantidad de SU. No definido explícitamente

Límites del priorizador semántico

El clasificador semántico usa un sistema de puesta en cola para administrar solicitudes simultáneas. Este sistema permite a los servicios de búsqueda obtener el mayor número de consultas por segundo posible. Cuando se alcanza el límite de solicitudes simultáneas, el sistema coloca solicitudes adicionales en una cola. Si la cola está llena, el sistema rechaza más solicitudes y se deben reintentar.

Las consultas de clasificador semántico total por segundo varían en función de los siguientes factores:

  • Nivel del servicio de búsqueda. Tanto los límites de la capacidad de cola como los de solicitudes simultáneas varían según el nivel de servicio.
  • Número de unidades de búsqueda en el servicio de búsqueda. La manera más sencilla de aumentar la cantidad máxima de consultas simultáneas del clasificador semántico es agregar más unidades de búsqueda al servicio de búsqueda.
  • Capacidad total del clasificador semántico disponible en la región.
  • Cantidad de tiempo que se tarda en atender una consulta mediante el clasificador semántico. Este tiempo varía en función de la disponibilidad del servicio de búsqueda.

En la tabla siguiente se describen los límites de restricción del clasificador semántico por nivel de servicio, sujeto a la capacidad disponible en la región. Puede ponerse en contacto con el soporte técnico de Microsoft para solicitar un aumento del límite.

Recurso Básico S1 S2 S3 S3 HD L1 L2 Desarrollador sin servidor
Número máximo de solicitudes simultáneas (por unidad de búsqueda) 2 3 4 4 4 4 4 4 (por servicio)
Tamaño máximo de la cola de solicitudes (por unidad de búsqueda) 4 6 8 8 8 8 8 8 (por servicio)

Límites de solicitud de API

Existen límites en las consultas porque las consultas no acotadas pueden desestabilizar el servicio de búsqueda. Normalmente, estas consultas se crean mediante programación. Si su aplicación genera consultas de búsqueda de forma programática, diseñela de modo que no genere consultas de tamaño ilimitado.

Existen límites en las cargas por motivos similares, lo que garantiza la estabilidad del servicio de búsqueda. El límite se aplica a toda la solicitud, incluidos todos sus componentes. Por ejemplo, si la solicitud agrupa por lotes varios documentos o comandos, toda la solicitud debe ajustarse al límite admitido.

Si debe superar un límite admitido, pruebe la carga de trabajo para saber qué esperar.

Con excepción de donde se indique, las siguientes solicitudes de API se aplican a todas las interfaces programables, incluidos los SDK de Azure.

General:

  • El límite máximo de carga admitido es de 16 MB para la indexación y la solicitud de consultas a través de la API de REST y los SDK.
  • Longitud máxima de la URL de 8 KB (solo se aplica a las API de REST)

API de indexación:

  • Se admiten un máximo de 1.000 documentos por lote en cargas, combinaciones o eliminaciones de índices.
  • Cada solicitud admite entre 1 y 32 000 acciones de indexación.

API de consulta:

  • Máximo de 10 campos en una consulta vectorial
  • máximo de 32 campos en la cláusula $orderby.
  • Máximo de 100 000 caracteres en una cláusula de búsqueda.
  • El número máximo de cláusulas en la búsqueda es de 3000.
  • Límites máximos de consultas de caracteres comodín y expresiones regulares, según lo exigido por Lucene. Limita el número de patrones, variaciones o coincidencias a 1000 instancias. Este límite se aplica para evitar la sobrecarga del motor.

Búsqueda de términos:

  • el tamaño máximo admitido de términos de búsqueda es de 32 766 bytes (32 KB menos 2 bytes) de texto con codificación UTF-8. Se aplica a la búsqueda de palabras clave y a la propiedad de texto de la búsqueda vectorial.
  • El tamaño máximo admitido de términos de búsqueda es de 1000 caracteres para la búsqueda de prefijos y la búsqueda de expresiones regulares.

Límites de respuesta de API

  • Cada página de resultados de búsqueda devuelve hasta 1000 documentos.
  • Cada solicitud de LA API de sugerencias devuelve hasta 100 sugerencias.

El motor de búsqueda devuelve 50 resultados de forma predeterminada, pero puede invalidar este parámetro hasta el límite máximo.

Límites de clave de API

Use claves de API para la autenticación del servicio. Existen dos tipos de claves de API. Las claves de administrador, que especifica en el encabezado de solicitud, proporcionan acceso completo de lectura y escritura al servicio. Las claves de consulta, que se especifican en la dirección URL, son de solo lectura y normalmente se distribuyen a las aplicaciones cliente.

  • Cada servicio admite hasta dos claves de administrador.
  • Cada servicio admite hasta 50 claves de consulta.