Quotas e limites do Azure OpenAI nos modelos do Microsoft Foundry

Este artigo contém uma referência rápida e uma descrição detalhada das quotas e limites para o Azure OpenAI.

Âmbito da quota

Quotas e limites não são aplicados ao nível do inquilino. Em vez disso, o nível mais elevado de restrições de quotas é definido ao nível de subscrição do Azure.

Gestão de quotas ao nível de subscrição

Importante

A gestão de quotas a nível de subscrição no Microsoft Foundry começou após 7 de maio de 2026.

Começando com o Realtime Translate e o Realtime Whisper, e em breve todos os modelos, o Foundry acompanha a quota de implementações ao nível da subscrição, em vez de por recurso ou região. Esta abordagem traz consistência e previsibilidade à forma como as quotas são geridas entre implementações, uma vez que todos os recursos e regiões de uma subscrição partilham o mesmo pool de quotas.

Esta alteração consolida a quota em pools partilhados:

  • Padrão Global: Implementações do mesmo modelo e versão partilham um único pool de quotas em todas as regiões de uma subscrição.
  • Data Zone Standard: Implementações do mesmo modelo e versão partilham um pool de quotas por zona de dados (por exemplo, EUA ou UE).

Para saber mais sobre a alocação de quotas ao nível da subscrição, consulte as quotas e limites do Microsoft Foundry Models.

Escalões de quotas

A Microsoft está a introduzir níveis de quota para melhorar a experiência dos Modelos Foundry e reduzir o atrito à medida que as cargas de trabalho aumentam. As quotas aumentam agora automaticamente com a utilização, ajudando a evitar erros nos limites de taxa e ao mesmo tempo a criar um ambiente mais justo para todos os utilizadores. Estão disponíveis sete níveis: Nível Gratuito e Níveis 1 a 6 – sendo que o Nível 6 oferece as quotas mais elevadas. O nível inicial atribuído a um cliente baseia-se na utilização atual desse modelo e na sua relação atual com Microsoft, como o estatuto de Acordo Empresarial (EA ou MCA-E). 

O que está a mudar para mim?

Anteriormente, a Foundry oferecia apenas níveis de quota Default e Enterprise para o tipo de oferta pay as you go, com um grande intervalo entre cada nível e um processo mais longo para solicitar aumentos. Com os Quota Tiers, todos os utilizadores recebem um nível com quotas iguais ou superiores aos níveis anteriores. Quaisquer aumentos de quotas previamente aprovados são mantidos e não serão reduzidos. À medida que a utilização cresce, a Foundry aumenta automaticamente as quotas ao transferir utilizadores para níveis superiores, e quotas adicionais ainda podem ser solicitadas através do formulário de quota.

Como é que um cliente se move automaticamente de um nível para outro, por exemplo, quais são os critérios para a mudança de nível? 

As subidas automáticas de escalão dependem principalmente das tendências de consumo dos clientes nos Foundry Models ao longo do tempo. Se a utilização de um cliente aumentar de tal forma que o seu nível de quota atual limite a sua capacidade de usar modelos Foundry, o sistema atualiza automaticamente o cliente para o nível superior seguinte. O sistema também considera a relação do cliente com a Microsoft. Clientes com relações empresariais (incluindo EA e MCA-E) com Microsoft recebem níveis de quota superiores. Além disso, a Microsoft também considera o histórico de pagamentos do cliente para determinar a elegibilidade para atualizações automáticas. 

Posso optar por não receber upgrades automáticos?

Sim, podes optar por não usar upgrades automáticos para ficares no teu nível atual, independentemente das alterações no teu consumo. Alguns clientes utilizam quotas para gerir a faturação. Usar quotas para gerir a faturação não é a melhor prática do Azure, mas se o seu sistema estiver configurado assim, talvez não queira quebrá-la. Para saber mais sobre gestão de faturação e melhores práticas, consulte Gestão de Custos.

Para optar por não participar, pode definir o seguinte flag para NoAutoUpgrade:

curl -X PATCH \
  "https://management.azure.com/subscriptions/00000000-0000-0000-0000-000000000000/providers/Microsoft.CognitiveServices/quotaTiers/default?api-version=2025-10-01-preview" \
  -H "Authorization: Bearer <YOUR_ACCESS_TOKEN>" \
  -H "Content-Type: application/json" \
  -d '{
    "properties": {
      "tierUpgradePolicy": "NoAutoUpgrade"
    }
  }'

Nota

A funcionalidade de opt out é uma pré-visualização e pode estar sujeita a alterações ou remoção no futuro.

Posso pedir mais quota?

Sim, usando o formulário de pedido de quotas podes sempre pedir mais quotas. Se o pedido for aprovado, o nível atual permanecerá o mesmo, mas com mais quotas atribuídas.

Como posso verificar o nível de quota da minha subscrição?

Atualmente, pode verificar o seu nível de quota com a API do plano de controlo:

curl -X GET \
  "https://management.azure.com/subscriptions/00000000-0000-0000-0000-000000000000/providers/Microsoft.CognitiveServices/quotaTiers?api-version=2025-10-01-preview" \
  -H "Authorization: Bearer $(az account get-access-token --resource https://management.azure.com --query accessToken -o tsv)" \
  -H "Content-Type: application/json"

Referência de nível de quota

Todas as versões gpt-chat-latest utilizam o mesmo limite de TPM do nível indicado para cada nível. As versões 2026-05-05, 2026-05-28, e 2026-06-241 usam 10 RPM por 1.000 TPM. A versão 2026-08-062 utiliza 1 RPM por cada 1.000 TPM, pelo que as tabelas listam as versões separadamente.

Nível 1

Nome do Modelo Tipo de Implantação Pedidos por Minuto (RPM) Tokens por Minuto (TPM)
Codex-mini GlobalStandard 1,000 1,000,000
prévia de uso do computador GlobalStandard 4,500 450.000
GPT-4.1 DataZoneStandard 300 300,000
GPT-4.1 GlobalStandard 1,000 1,000,000
GPT-4.1-mini DataZoneStandard 2.000 2,000,000
GPT-4.1-mini GlobalStandard 5,000 5,000,000
GPT-4.1-mini Standard 6,000 6,000,000
gpt-4.1-nano DataZoneStandard 2.000 2,000,000
gpt-4.1-nano GlobalStandard 5,000 5,000,000
GPT-4O DataZoneStandard 300 / 10 segundos 300,000
gpt-4o-audio-preview GlobalStandard 30000 / 10s 30,000,000
GPT-4O-mini DataZoneStandard 10.000 1,000,000
GPT-4O-mini GlobalStandard 20,000 2,000,000
gpt-4o-mini-audio-preview (pré-visualização de áudio mini gpt-4o) GlobalStandard 30000 / 10s 30,000,000
gpt-4o-mini-previsualização-em-tempo-real GlobalStandard 36 6,000
gpt-4o-visualização-em-tempo-real GlobalStandard 36 6,000
GPT-5 DataZoneStandard 3,000 300,000
GPT-5 GlobalStandard 10.000 1,000,000
gpt-5-chat GlobalStandard 1,000 1,000,000
Códice GPT-5 GlobalStandard 1,000 1,000,000
GPT-5-mini DataZoneStandard 300 300,000
GPT-5-mini GlobalStandard 1,000 1,000,000
GPT-5-nano DataZoneStandard 2.000 2,000,000
GPT-5-nano GlobalStandard 5,000 5,000,000
GPT-5-Pro GlobalStandard 1,600 160,000
GPT-5.1 DataZoneStandard 3,000 300,000
GPT-5.1 GlobalStandard 10.000 1,000,000
GPT-5.1 Standard 3,000 300,000
gpt-5.1-chat GlobalStandard 10.000 1,000,000
gpt-5.1-codex DataZoneStandard 3,000 300,000
gpt-5.1-codex GlobalStandard 1,000 1,000,000
gpt-5.1-codex-max GlobalStandard 10.000 1,000,000
GPT-5.1-Codex-Mini GlobalStandard 1,000 1,000,000
GPT-5.2 DataZoneStandard 3,000 300,000
GPT-5.2 GlobalStandard 10.000 1,000,000
gpt-5.2-chat GlobalStandard 10.000 1,000,000
gpt-5.3-chat GlobalStandard 1,000 1,000,000
GPT-5.2-codex GlobalStandard 10.000 1,000,000
gpt-5.3-codex GlobalStandard 10.000 1,000,000
GPT-5.4 DataZoneStandard 300 300,000
GPT-5.4 GlobalStandard 10.000 1,000,000
GPT-5.4-Pro GlobalStandard 160 160,000
GPT-5.4-MINI GlobalStandard 1,000 1,000,000
GPT-5.4-NANO DataZoneStandard 2.000 2,000,000
GPT-5.4-NANO GlobalStandard 5,000 5,000,000
GPT-5.5 DataZoneStandard 333 333,000
GPT-5.5 GlobalStandard 1,000 1,000,000
gpt-5.6-luna DataZoneStandard 333 333,000
gpt-5.6-luna GlobalStandard 1,000 1,000,000
GPT-5.6-SOL DataZoneStandard 333 333,000
GPT-5.6-SOL GlobalStandard 1,000 1,000,000
gpt-5.6-terra DataZoneStandard 333 333,000
gpt-5.6-terra GlobalStandard 1,000 1,000,000
gpt-chat-latest1 GlobalStandard 10.000 1,000,000
gpt-chat-latest2 GlobalStandard 1,000 1,000,000
GPT-Audio GlobalStandard 30000 / 10s 30,000,000
GPT-imagem-1 GlobalStandard 9 -
GPT-image-1-mini GlobalStandard 12 -
gpt-image-1.5 DataZoneStandard 3 -
gpt-image-1.5 GlobalStandard 9 -
GPT-imagem-2 DataZoneStandard 2 -
GPT-imagem-2 GlobalStandard 6 -
GPT-tempo real GlobalStandard 200 100,000
model-router DataZoneStandard 300 300,000
model-router GlobalStandard 1,000 1,000,000
o1 DataZoneStandard 100 600,000
o1 GlobalStandard 500 3,000,000
o3 DataZoneStandard 300 300,000
o3 GlobalStandard 1,000 1,000,000
O3-Deep-Research GlobalStandard 3,000 3,000,000
O3-mini DataZoneStandard 200 2,000,000
O3-mini GlobalStandard 500 5,000,000
O3-Pro GlobalStandard 160 1,600,000
O4-mini DataZoneStandard 300 / 10 segundos 300,000
O4-mini GlobalStandard 1,000 1,000,000
texto-embedding-3-grande DataZoneStandard 1,000 1,000,000
texto-embedding-3-grande GlobalStandard 1000 / 10 segundos 1,000,000
Embutir texto-3-pequeno DataZoneStandard 1,000 1,000,000
Embutir texto-3-pequeno GlobalStandard 1000 / 10 segundos 1,000,000

Quotas e limites de referência

A secção seguinte fornece-lhe um guia rápido sobre as quotas e limites padrão que se aplicam ao Azure OpenAI:

Nome do limite Valor limite
Recursos do Azure OpenAI por subscrição do Azure 30.
Limites de cota padrão para GPT-imagem-1 9 pedidos por minuto
Limites padrão de cotas GPT-image-1-mini 12 pedidos por minuto
Limites de quotas predefinidos GPT-imagem-1.5 9 pedidos por minuto
Limites de utilização padrão do GPT-imagem-2 9 pedidos por minuto
Limites padrão das quotas de Sora 60 pedidos por minuto.
Limites padrão de quotas do Sora 2 2 pedidos de emprego1 por minuto
Limites de quotas padrão da API de áudio para voz em texto 3 pedidos por minuto.
Máximo de tokens de prompt por pedido Varia consoante o modelo. Para mais informações, consulte Azure Modelos OpenAI.
Implementações padrão máximas por recurso 32.
Implementações máximas de modelos finamente ajustados 10.
Número total de empregos de formação por recurso 100.
Máximo de trabalhos de treino a serem executados simultaneamente por recurso Formação padrão e global: 3;
Formação de programadores: 5
Número máximo de tarefas de treinamento em fila 20.
Ficheiros máximos por recurso (ajuste fino) 100.
Tamanho total de todos os ficheiros por recurso (ajuste fino) 1 GB.
Tempo máximo de trabalho de formação (falha se o trabalho for ultrapassado) 720 horas.
Tamanho máximo do trabalho de treinamento (tokens in training file) x (# of epochs) 2 mil milhões.
Tamanho máximo de todos os ficheiros por upload (Azure OpenAI nos seus dados) 16 MB.
Número máximo de entradas num array com /embeddings 2,048.
Tokens máximos por /embeddings solicitação (soma de todas as entradas) 300,000.
Número máximo de /chat/completions mensagens 2,048.
Número máximo de /chat/completions funções 128.
Número máximo de /chat/completions ferramentas 128.
Número máximo de unidades de débito provisionadas por implementação 100,000.
Ficheiros máximos por assistente ou thread 10.000 ao usar a API ou o portal Microsoft Foundry.
Tamanho máximo do ficheiro para assistentes e afinação 512 MB através da API

200 MB através do portal Foundry.
Pedidos máximos de upload de ficheiros por recurso 30 pedidos por segundo.
Tamanho máximo para todos os ficheiros carregados para assistentes 200 GB.
Limite de tokens para assistentes Limite de 2.000.000 de tokens.
GPT-4o e GPT-4.1 número máximo de imagens por pedido (número de imagens no array de mensagens ou histórico de conversas) 50.
GPT-4 vision-preview e GPT-4 turbo-2024-04-09 tokens máximos padrão 16.

Aumente o valor do max_tokens parâmetro para evitar respostas truncadas. GPT-4o o número máximo de tokens predefinido é 4,096.
Número máximo de cabeçalhos personalizados em pedidos API2 10.
Limite de caracteres da mensagem 1,048,576.
Tamanho da mensagem para ficheiros de áudio 20 MB.

1 A quota de 2 RPM do Sora só conta pedidos de trabalho por vídeo. Outros tipos de pedidos não têm limitação de taxa.

2 As nossas APIs atuais permitem até 10 cabeçalhos personalizados, que são passados pelo pipeline e devolvidos. Alguns clientes agora ultrapassam este número de cabeçalhos, o que resulta em erros HTTP 431. Não há solução para este erro, a não ser reduzir o volume do cabeçalho. Nas futuras versões da API, não passaremos pelos cabeçalhos personalizados. Recomendamos que os clientes não dependam de cabeçalhos personalizados em futuras arquiteturas de sistema.

Nota

Os limites das quotas estão sujeitos a alterações.

Limites de processamento em lote

Nome do limite Valor limite
Ficheiros de entrada em lote máximo (sem expiração) 500
Número máximo de ficheiros de entrada por lote (com expiração definida) 10.000
Tamanho máximo do ficheiro de entrada 200 MB
Tamanho máximo do ficheiro de entrada - Traga o seu próprio armazenamento (BYOS) 1 GB
Pedidos máximos por ficheiro 100,000

Nota

Defina a expiração dos ficheiros de entrada para aumentar o limite por recurso e gere os ficheiros armazenados. Os limites dos ficheiros de entrada em lote não se aplicam a ficheiros de saída, como result.jsonl e error.jsonl. Para evitar os limites de ficheiros de entrada da API dos Ficheiros, use Batch com Armazenamento de Blobs do Azure.

Quota de lote

A tabela mostra o limite da quota de lote. Os valores de quota para lotes de dados globais são representados em termos de tokens enfileirados. Quando submete um ficheiro para processamento em lote, o número de tokens no ficheiro é contado. Até que o batch job atinja um estado terminal, esses tokens são contabilizados no seu limite total de tokens em fila.

Lote global

Modelo Enterprise e MCA-E Padrão Subscrições mensais baseadas em cartão de crédito Subscrições MSDN Azure for Students, testes gratuitos
gpt-4.1 5B 200M 50M 90K N/A
gpt-4.1 mini 15B 1B 50M 90K N/A
gpt-4.1-nano 15B 1B 50M 90K N/A
gpt-4o 5B 200M 50M 90K N/A
gpt-4o-mini 15B 1B 50M 90K N/A
gpt-4-turbo 300M 80M 40M 90K N/A
gpt-4 150 MB 30 milhões 5 milhões 100K N/A
o3-mini 15B 1B 50M 90K N/A
o4-mini 15B 1B 50M 90K N/A
gpt-5 5B 200M 50M 90K N/A
gpt-5.1 5B 200M 50M 90K N/A
gpt-5.2 5B 200M 50M N/A N/A
gpt-5.4 5B 200M 50M N/A N/A
gpt-5.4-mini 5B 200M 50M N/A N/A
gpt-5.4-nano 5B 200M 50M N/A N/A
gpt-5.5 5B 200M 50M 90K N/A

B = biliões | M = milhão | K = mil

Lote de zona de dados

Modelo Enterprise e MCA-E Padrão Subscrições mensais baseadas em cartão de crédito Subscrições MSDN Azure for Students, testes gratuitos
gpt-4.1 500M 30 milhões 30 milhões 90K N/A
gpt-4.1-mini 1,5B 100M 50M 90K N/A
gpt-4o 500M 30 milhões 30 milhões 90K N/A
gpt-4o-mini 1,5B 100M 50M 90K N/A
o3-mini 1,5B 100M 50M 90K N/A
gpt-5 5B 200M 50M 90K N/A
gpt-5.1 5B 200M 50M 90K N/A
gpt-5.4 5B 200M 50M N/A N/A
gpt-5.4-mini 5B 200M 50M N/A N/A
gpt-5.5 5B 200M 50M 90K N/A

GPT-OSS

Modelo Tokens por minuto (TPM) Pedidos por minuto (RPM)
gpt-oss-120b 5 milhões 5 K

Níveis de utilização

As implementações de Global Standard utilizam a infraestrutura global do Azure. Eles encaminham dinamicamente o tráfego dos clientes para o centro de dados com a melhor disponibilidade para os pedidos de inferência do cliente. De forma semelhante, as implementações do Data Zone Standard permitem usar a infraestrutura global do Azure para encaminhar dinamicamente o tráfego para o data center dentro da zona de dados definida pela Microsoft, com a melhor disponibilidade para cada pedido. Esta prática permite uma latência mais consistente para clientes com níveis baixos a médios de tráfego. Clientes com níveis elevados de utilização sustentada podem observar maior variabilidade na latência de resposta.

Os níveis de utilização do Azure OpenAI foram concebidos para proporcionar desempenho consistente à maioria dos clientes com níveis baixos a médios de tráfego. Cada nível de utilização define o débito máximo (tokens por minuto) que se pode esperar com latência previsível. Quando o seu uso se mantém dentro do seu nível atribuído, a latência mantém-se estável e os tempos de resposta são consistentes.

O que acontece se ultrapassares o teu nível de utilização?

  • Se a taxa de processamento do seu pedido exceder o seu nível de utilização — especialmente durante períodos de alta procura — a sua latência de resposta pode aumentar significativamente.
  • A latência pode variar e, em alguns casos, pode ser mais do que o dobro do que ao operar dentro do seu escalão de utilização.
  • Esta variabilidade é mais notória em clientes com uso sustentado elevado ou padrões de tráfego intermitente.

Se encontrar erros 429 ou notar um aumento da variabilidade na latência, siga os seguintes passos:

  • Solicite um aumento de quota: visite o portal do Azure para solicitar uma quota maior para a sua subscrição.
  • Considere atualizar para uma oferta premium (PTU): para cargas de trabalho críticas de latência ou de alto volume, atualize para Unidades de Débito Provisionadas (PTU). A PTU oferece recursos dedicados, capacidade garantida e latência previsível — mesmo em larga escala. Esta é a melhor escolha para aplicações críticas à missão que exigem desempenho consistente.
  • Monitorize a sua utilização: reveja regularmente as métricas de utilização no portal do Azure para garantir que está a operar dentro dos seus limites de nível. Ajusta a tua carga de trabalho ou estratégia de implementação conforme necessário.

Poderá receber respostas 429 (Demasiados pedidos) mesmo quando as métricas de utilização de tokens pareçam estar abaixo da sua quota. Para uma explicação de por que motivo isto acontece, consulte Por que motivo poderá ver erros 429 mesmo quando as métricas de utilização de tokens estão abaixo do limite da quota.

O limite de utilização determina o nível de utilização acima do qual os clientes podem observar maior variabilidade na latência de resposta. O uso do cliente é definido por modelo. É o número total de tokens consumidos em todas as implementações, em todas as subscrições, em todas as regiões para um dado inquilino.

Nota

Os níveis de utilização aplicam-se apenas aos tipos de implementação Standard, Data Zone Standard e Global Standard. Os níveis de utilização não se aplicam a implementações globais em lote e largura de banda provisionada.

Padrão Global, Padrão de Zona de Dados e Padrão

Modelo Níveis de utilização por mês
gpt-5 32 mil milhões de tokens
gpt-5-mini 160 mil milhões de tokens
gpt-5-nano 800 mil milhões de tokens
gpt-5-chat 32 mil milhões de tokens
gpt-4 + gpt-4-32k (todas as versões) 6 mil milhões de tokens
gpt-4o 12 mil milhões de tokens
gpt-4o-mini 85 mil milhões de tokens
o3-mini 50 mil milhões de tokens
o1 4 mil milhões de tokens
o4-mini 50 mil milhões de tokens
o3 5 mil milhões de tokens
gpt-4.1 30 mil milhões de tokens
gpt-4.1-mini 150 mil milhões de tokens
gpt-4.1-nano 550 mil milhões de tokens
gpt-5.1 86 mil milhões de tokens
gpt-5.1-codex 86 mil milhões de tokens
gpt-5.2 60 mil milhões de tokens
gpt-5.3-codex 60 mil milhões de tokens
gpt-5.4 50 mil milhões de tokens
gpt-5.4-mini 165 mil milhões de tokens
gpt-5.4-nano 605 mil milhões de tokens
gpt-5.5 25 mil milhões de tokens
gpt-5.6-sol 25 mil milhões de tokens

Melhores práticas gerais para manter os limites de taxa

Para minimizar problemas relacionados com os limites de taxa, é aconselhável utilizar as seguintes técnicas:

  • Implementa lógica de repetição na sua aplicação.
  • Evite mudanças bruscas na carga de trabalho. Aumenta a carga de trabalho gradualmente.
  • Testa diferentes padrões de aumento de carga.
  • Aumente a quota atribuída à sua missão. Transferir quota de outra missão, se necessário.

Para obter boas práticas detalhadas, exemplos de código para repetição com intervalo progressivo e um guia de resolução de problemas do erro 429, consulte Manage Azure OpenAI in Microsoft Foundry Models quota.

Aumentos das quotas de pedidos

Submeta o formulário de pedido de aumento de quota para solicitar aumentos de quota para Modelos Foundry vendidos pela Azure, modelos do Azure OpenAI e modelos Anthropic. Exceto para modelos Anthropic, modelos de parceiros e comunidade não suportam aumentos de cotas.

Os pedidos de aumento de quotas são processados pela ordem em que são recebidos, e a prioridade vai para os clientes que utilizam ativamente a sua quota de alocação existente. Pedidos que não cumpram esta condição podem ser recusados.

Limites regionais de capacidade de quotas

Pode consultar a disponibilidade de quotas por região para a sua subscrição no portal da Foundry.

Para verificar quotas e capacidade programáticamente, consulte Verificação Programática de quotas e capacidade no guia de gestão de quotas. Essa secção abrange duas APIs REST complementares: a API de Utilizações para verificar o consumo em relação a limites, e a API de Capacidades de Modelo para verificar a capacidade de implementação disponível por modelo e região.

Nota

Atualmente, tanto o portal Foundry como as APIs de capacidade devolvem informações de quotas e capacidade para modelos que estão retirados e já não estão disponíveis para novas implementações.