Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
Este artigo contém uma referência rápida e uma descrição detalhada das quotas e limites para o Azure OpenAI.
Âmbito da quota
Quotas e limites não são aplicados ao nível do inquilino. Em vez disso, o nível mais elevado de restrições de quotas é definido ao nível de subscrição do Azure.
Gestão de quotas ao nível de subscrição
Importante
A gestão de quotas a nível de subscrição no Microsoft Foundry começou após 7 de maio de 2026.
Começando com o Realtime Translate e o Realtime Whisper, e em breve todos os modelos, o Foundry acompanha a quota de implementações ao nível da subscrição, em vez de por recurso ou região. Esta abordagem traz consistência e previsibilidade à forma como as quotas são geridas entre implementações, uma vez que todos os recursos e regiões de uma subscrição partilham o mesmo pool de quotas.
Esta alteração consolida a quota em pools partilhados:
- Padrão Global: Implementações do mesmo modelo e versão partilham um único pool de quotas em todas as regiões de uma subscrição.
- Data Zone Standard: Implementações do mesmo modelo e versão partilham um pool de quotas por zona de dados (por exemplo, EUA ou UE).
Para saber mais sobre a alocação de quotas ao nível da subscrição, consulte as quotas e limites do Microsoft Foundry Models.
Escalões de quotas
A Microsoft está a introduzir níveis de quota para melhorar a experiência dos Modelos Foundry e reduzir o atrito à medida que as cargas de trabalho aumentam. As quotas aumentam agora automaticamente com a utilização, ajudando a evitar erros nos limites de taxa e ao mesmo tempo a criar um ambiente mais justo para todos os utilizadores. Estão disponíveis sete níveis: Nível Gratuito e Níveis 1 a 6 – sendo que o Nível 6 oferece as quotas mais elevadas. O nível inicial atribuído a um cliente baseia-se na utilização atual desse modelo e na sua relação atual com Microsoft, como o estatuto de Acordo Empresarial (EA ou MCA-E).
O que está a mudar para mim?
Anteriormente, a Foundry oferecia apenas níveis de quota Default e Enterprise para o tipo de oferta pay as you go, com um grande intervalo entre cada nível e um processo mais longo para solicitar aumentos. Com os Quota Tiers, todos os utilizadores recebem um nível com quotas iguais ou superiores aos níveis anteriores. Quaisquer aumentos de quotas previamente aprovados são mantidos e não serão reduzidos. À medida que a utilização cresce, a Foundry aumenta automaticamente as quotas ao transferir utilizadores para níveis superiores, e quotas adicionais ainda podem ser solicitadas através do formulário de quota.
Como é que um cliente se move automaticamente de um nível para outro, por exemplo, quais são os critérios para a mudança de nível?
As subidas automáticas de escalão dependem principalmente das tendências de consumo dos clientes nos Foundry Models ao longo do tempo. Se a utilização de um cliente aumentar de tal forma que o seu nível de quota atual limite a sua capacidade de usar modelos Foundry, o sistema atualiza automaticamente o cliente para o nível superior seguinte. O sistema também considera a relação do cliente com a Microsoft. Clientes com relações empresariais (incluindo EA e MCA-E) com Microsoft recebem níveis de quota superiores. Além disso, a Microsoft também considera o histórico de pagamentos do cliente para determinar a elegibilidade para atualizações automáticas.
Posso optar por não receber upgrades automáticos?
Sim, podes optar por não usar upgrades automáticos para ficares no teu nível atual, independentemente das alterações no teu consumo. Alguns clientes utilizam quotas para gerir a faturação. Usar quotas para gerir a faturação não é a melhor prática do Azure, mas se o seu sistema estiver configurado assim, talvez não queira quebrá-la. Para saber mais sobre gestão de faturação e melhores práticas, consulte Gestão de Custos.
Para optar por não participar, pode definir o seguinte flag para NoAutoUpgrade:
curl -X PATCH \
"https://management.azure.com/subscriptions/00000000-0000-0000-0000-000000000000/providers/Microsoft.CognitiveServices/quotaTiers/default?api-version=2025-10-01-preview" \
-H "Authorization: Bearer <YOUR_ACCESS_TOKEN>" \
-H "Content-Type: application/json" \
-d '{
"properties": {
"tierUpgradePolicy": "NoAutoUpgrade"
}
}'
Nota
A funcionalidade de opt out é uma pré-visualização e pode estar sujeita a alterações ou remoção no futuro.
Posso pedir mais quota?
Sim, usando o formulário de pedido de quotas podes sempre pedir mais quotas. Se o pedido for aprovado, o nível atual permanecerá o mesmo, mas com mais quotas atribuídas.
Como posso verificar o nível de quota da minha subscrição?
Atualmente, pode verificar o seu nível de quota com a API do plano de controlo:
curl -X GET \
"https://management.azure.com/subscriptions/00000000-0000-0000-0000-000000000000/providers/Microsoft.CognitiveServices/quotaTiers?api-version=2025-10-01-preview" \
-H "Authorization: Bearer $(az account get-access-token --resource https://management.azure.com --query accessToken -o tsv)" \
-H "Content-Type: application/json"
Referência de nível de quota
Todas as versões gpt-chat-latest utilizam o mesmo limite de TPM do nível indicado para cada nível. As versões 2026-05-05, 2026-05-28, e 2026-06-241 usam 10 RPM por 1.000 TPM. A versão 2026-08-062 utiliza 1 RPM por cada 1.000 TPM, pelo que as tabelas listam as versões separadamente.
Nível 1
| Nome do Modelo | Tipo de Implantação | Pedidos por Minuto (RPM) | Tokens por Minuto (TPM) |
|---|---|---|---|
| Codex-mini | GlobalStandard | 1,000 | 1,000,000 |
| prévia de uso do computador | GlobalStandard | 4,500 | 450.000 |
| GPT-4.1 | DataZoneStandard | 300 | 300,000 |
| GPT-4.1 | GlobalStandard | 1,000 | 1,000,000 |
| GPT-4.1-mini | DataZoneStandard | 2.000 | 2,000,000 |
| GPT-4.1-mini | GlobalStandard | 5,000 | 5,000,000 |
| GPT-4.1-mini | Standard | 6,000 | 6,000,000 |
| gpt-4.1-nano | DataZoneStandard | 2.000 | 2,000,000 |
| gpt-4.1-nano | GlobalStandard | 5,000 | 5,000,000 |
| GPT-4O | DataZoneStandard | 300 / 10 segundos | 300,000 |
| gpt-4o-audio-preview | GlobalStandard | 30000 / 10s | 30,000,000 |
| GPT-4O-mini | DataZoneStandard | 10.000 | 1,000,000 |
| GPT-4O-mini | GlobalStandard | 20,000 | 2,000,000 |
| gpt-4o-mini-audio-preview (pré-visualização de áudio mini gpt-4o) | GlobalStandard | 30000 / 10s | 30,000,000 |
| gpt-4o-mini-previsualização-em-tempo-real | GlobalStandard | 36 | 6,000 |
| gpt-4o-visualização-em-tempo-real | GlobalStandard | 36 | 6,000 |
| GPT-5 | DataZoneStandard | 3,000 | 300,000 |
| GPT-5 | GlobalStandard | 10.000 | 1,000,000 |
| gpt-5-chat | GlobalStandard | 1,000 | 1,000,000 |
| Códice GPT-5 | GlobalStandard | 1,000 | 1,000,000 |
| GPT-5-mini | DataZoneStandard | 300 | 300,000 |
| GPT-5-mini | GlobalStandard | 1,000 | 1,000,000 |
| GPT-5-nano | DataZoneStandard | 2.000 | 2,000,000 |
| GPT-5-nano | GlobalStandard | 5,000 | 5,000,000 |
| GPT-5-Pro | GlobalStandard | 1,600 | 160,000 |
| GPT-5.1 | DataZoneStandard | 3,000 | 300,000 |
| GPT-5.1 | GlobalStandard | 10.000 | 1,000,000 |
| GPT-5.1 | Standard | 3,000 | 300,000 |
| gpt-5.1-chat | GlobalStandard | 10.000 | 1,000,000 |
| gpt-5.1-codex | DataZoneStandard | 3,000 | 300,000 |
| gpt-5.1-codex | GlobalStandard | 1,000 | 1,000,000 |
| gpt-5.1-codex-max | GlobalStandard | 10.000 | 1,000,000 |
| GPT-5.1-Codex-Mini | GlobalStandard | 1,000 | 1,000,000 |
| GPT-5.2 | DataZoneStandard | 3,000 | 300,000 |
| GPT-5.2 | GlobalStandard | 10.000 | 1,000,000 |
| gpt-5.2-chat | GlobalStandard | 10.000 | 1,000,000 |
| gpt-5.3-chat | GlobalStandard | 1,000 | 1,000,000 |
| GPT-5.2-codex | GlobalStandard | 10.000 | 1,000,000 |
| gpt-5.3-codex | GlobalStandard | 10.000 | 1,000,000 |
| GPT-5.4 | DataZoneStandard | 300 | 300,000 |
| GPT-5.4 | GlobalStandard | 10.000 | 1,000,000 |
| GPT-5.4-Pro | GlobalStandard | 160 | 160,000 |
| GPT-5.4-MINI | GlobalStandard | 1,000 | 1,000,000 |
| GPT-5.4-NANO | DataZoneStandard | 2.000 | 2,000,000 |
| GPT-5.4-NANO | GlobalStandard | 5,000 | 5,000,000 |
| GPT-5.5 | DataZoneStandard | 333 | 333,000 |
| GPT-5.5 | GlobalStandard | 1,000 | 1,000,000 |
| gpt-5.6-luna | DataZoneStandard | 333 | 333,000 |
| gpt-5.6-luna | GlobalStandard | 1,000 | 1,000,000 |
| GPT-5.6-SOL | DataZoneStandard | 333 | 333,000 |
| GPT-5.6-SOL | GlobalStandard | 1,000 | 1,000,000 |
| gpt-5.6-terra | DataZoneStandard | 333 | 333,000 |
| gpt-5.6-terra | GlobalStandard | 1,000 | 1,000,000 |
| gpt-chat-latest1 | GlobalStandard | 10.000 | 1,000,000 |
| gpt-chat-latest2 | GlobalStandard | 1,000 | 1,000,000 |
| GPT-Audio | GlobalStandard | 30000 / 10s | 30,000,000 |
| GPT-imagem-1 | GlobalStandard | 9 | - |
| GPT-image-1-mini | GlobalStandard | 12 | - |
| gpt-image-1.5 | DataZoneStandard | 3 | - |
| gpt-image-1.5 | GlobalStandard | 9 | - |
| GPT-imagem-2 | DataZoneStandard | 2 | - |
| GPT-imagem-2 | GlobalStandard | 6 | - |
| GPT-tempo real | GlobalStandard | 200 | 100,000 |
| model-router | DataZoneStandard | 300 | 300,000 |
| model-router | GlobalStandard | 1,000 | 1,000,000 |
| o1 | DataZoneStandard | 100 | 600,000 |
| o1 | GlobalStandard | 500 | 3,000,000 |
| o3 | DataZoneStandard | 300 | 300,000 |
| o3 | GlobalStandard | 1,000 | 1,000,000 |
| O3-Deep-Research | GlobalStandard | 3,000 | 3,000,000 |
| O3-mini | DataZoneStandard | 200 | 2,000,000 |
| O3-mini | GlobalStandard | 500 | 5,000,000 |
| O3-Pro | GlobalStandard | 160 | 1,600,000 |
| O4-mini | DataZoneStandard | 300 / 10 segundos | 300,000 |
| O4-mini | GlobalStandard | 1,000 | 1,000,000 |
| texto-embedding-3-grande | DataZoneStandard | 1,000 | 1,000,000 |
| texto-embedding-3-grande | GlobalStandard | 1000 / 10 segundos | 1,000,000 |
| Embutir texto-3-pequeno | DataZoneStandard | 1,000 | 1,000,000 |
| Embutir texto-3-pequeno | GlobalStandard | 1000 / 10 segundos | 1,000,000 |
Quotas e limites de referência
A secção seguinte fornece-lhe um guia rápido sobre as quotas e limites padrão que se aplicam ao Azure OpenAI:
| Nome do limite | Valor limite |
|---|---|
| Recursos do Azure OpenAI por subscrição do Azure | 30. |
| Limites de cota padrão para GPT-imagem-1 | 9 pedidos por minuto |
| Limites padrão de cotas GPT-image-1-mini | 12 pedidos por minuto |
| Limites de quotas predefinidos GPT-imagem-1.5 | 9 pedidos por minuto |
| Limites de utilização padrão do GPT-imagem-2 | 9 pedidos por minuto |
| Limites padrão das quotas de Sora | 60 pedidos por minuto. |
| Limites padrão de quotas do Sora 2 | 2 pedidos de emprego1 por minuto |
| Limites de quotas padrão da API de áudio para voz em texto | 3 pedidos por minuto. |
| Máximo de tokens de prompt por pedido | Varia consoante o modelo. Para mais informações, consulte Azure Modelos OpenAI. |
| Implementações padrão máximas por recurso | 32. |
| Implementações máximas de modelos finamente ajustados | 10. |
| Número total de empregos de formação por recurso | 100. |
| Máximo de trabalhos de treino a serem executados simultaneamente por recurso | Formação padrão e global: 3; Formação de programadores: 5 |
| Número máximo de tarefas de treinamento em fila | 20. |
| Ficheiros máximos por recurso (ajuste fino) | 100. |
| Tamanho total de todos os ficheiros por recurso (ajuste fino) | 1 GB. |
| Tempo máximo de trabalho de formação (falha se o trabalho for ultrapassado) | 720 horas. |
Tamanho máximo do trabalho de treinamento (tokens in training file) x (# of epochs) |
2 mil milhões. |
| Tamanho máximo de todos os ficheiros por upload (Azure OpenAI nos seus dados) | 16 MB. |
Número máximo de entradas num array com /embeddings |
2,048. |
Tokens máximos por /embeddings solicitação (soma de todas as entradas) |
300,000. |
Número máximo de /chat/completions mensagens |
2,048. |
Número máximo de /chat/completions funções |
128. |
Número máximo de /chat/completions ferramentas |
128. |
| Número máximo de unidades de débito provisionadas por implementação | 100,000. |
| Ficheiros máximos por assistente ou thread | 10.000 ao usar a API ou o portal Microsoft Foundry. |
| Tamanho máximo do ficheiro para assistentes e afinação | 512 MB através da API 200 MB através do portal Foundry. |
| Pedidos máximos de upload de ficheiros por recurso | 30 pedidos por segundo. |
| Tamanho máximo para todos os ficheiros carregados para assistentes | 200 GB. |
| Limite de tokens para assistentes | Limite de 2.000.000 de tokens. |
GPT-4o e GPT-4.1 número máximo de imagens por pedido (número de imagens no array de mensagens ou histórico de conversas) |
50. |
GPT-4 vision-preview e GPT-4 turbo-2024-04-09 tokens máximos padrão |
16. Aumente o valor do max_tokens parâmetro para evitar respostas truncadas.
GPT-4o o número máximo de tokens predefinido é 4,096. |
| Número máximo de cabeçalhos personalizados em pedidos API2 | 10. |
| Limite de caracteres da mensagem | 1,048,576. |
| Tamanho da mensagem para ficheiros de áudio | 20 MB. |
1 A quota de 2 RPM do Sora só conta pedidos de trabalho por vídeo. Outros tipos de pedidos não têm limitação de taxa.
2 As nossas APIs atuais permitem até 10 cabeçalhos personalizados, que são passados pelo pipeline e devolvidos. Alguns clientes agora ultrapassam este número de cabeçalhos, o que resulta em erros HTTP 431. Não há solução para este erro, a não ser reduzir o volume do cabeçalho. Nas futuras versões da API, não passaremos pelos cabeçalhos personalizados. Recomendamos que os clientes não dependam de cabeçalhos personalizados em futuras arquiteturas de sistema.
Nota
Os limites das quotas estão sujeitos a alterações.
Limites de processamento em lote
| Nome do limite | Valor limite |
|---|---|
| Ficheiros de entrada em lote máximo (sem expiração) | 500 |
| Número máximo de ficheiros de entrada por lote (com expiração definida) | 10.000 |
| Tamanho máximo do ficheiro de entrada | 200 MB |
| Tamanho máximo do ficheiro de entrada - Traga o seu próprio armazenamento (BYOS) | 1 GB |
| Pedidos máximos por ficheiro | 100,000 |
Nota
Defina a expiração dos ficheiros de entrada para aumentar o limite por recurso e gere os ficheiros armazenados. Os limites dos ficheiros de entrada em lote não se aplicam a ficheiros de saída, como result.jsonl e error.jsonl. Para evitar os limites de ficheiros de entrada da API dos Ficheiros, use Batch com Armazenamento de Blobs do Azure.
Quota de lote
A tabela mostra o limite da quota de lote. Os valores de quota para lotes de dados globais são representados em termos de tokens enfileirados. Quando submete um ficheiro para processamento em lote, o número de tokens no ficheiro é contado. Até que o batch job atinja um estado terminal, esses tokens são contabilizados no seu limite total de tokens em fila.
Lote global
| Modelo | Enterprise e MCA-E | Padrão | Subscrições mensais baseadas em cartão de crédito | Subscrições MSDN | Azure for Students, testes gratuitos |
|---|---|---|---|---|---|
gpt-4.1 |
5B | 200M | 50M | 90K | N/A |
gpt-4.1 mini |
15B | 1B | 50M | 90K | N/A |
gpt-4.1-nano |
15B | 1B | 50M | 90K | N/A |
gpt-4o |
5B | 200M | 50M | 90K | N/A |
gpt-4o-mini |
15B | 1B | 50M | 90K | N/A |
gpt-4-turbo |
300M | 80M | 40M | 90K | N/A |
gpt-4 |
150 MB | 30 milhões | 5 milhões | 100K | N/A |
o3-mini |
15B | 1B | 50M | 90K | N/A |
o4-mini |
15B | 1B | 50M | 90K | N/A |
gpt-5 |
5B | 200M | 50M | 90K | N/A |
gpt-5.1 |
5B | 200M | 50M | 90K | N/A |
gpt-5.2 |
5B | 200M | 50M | N/A | N/A |
gpt-5.4 |
5B | 200M | 50M | N/A | N/A |
gpt-5.4-mini |
5B | 200M | 50M | N/A | N/A |
gpt-5.4-nano |
5B | 200M | 50M | N/A | N/A |
gpt-5.5 |
5B | 200M | 50M | 90K | N/A |
B = biliões | M = milhão | K = mil
Lote de zona de dados
| Modelo | Enterprise e MCA-E | Padrão | Subscrições mensais baseadas em cartão de crédito | Subscrições MSDN | Azure for Students, testes gratuitos |
|---|---|---|---|---|---|
gpt-4.1 |
500M | 30 milhões | 30 milhões | 90K | N/A |
gpt-4.1-mini |
1,5B | 100M | 50M | 90K | N/A |
gpt-4o |
500M | 30 milhões | 30 milhões | 90K | N/A |
gpt-4o-mini |
1,5B | 100M | 50M | 90K | N/A |
o3-mini |
1,5B | 100M | 50M | 90K | N/A |
gpt-5 |
5B | 200M | 50M | 90K | N/A |
gpt-5.1 |
5B | 200M | 50M | 90K | N/A |
gpt-5.4 |
5B | 200M | 50M | N/A | N/A |
gpt-5.4-mini |
5B | 200M | 50M | N/A | N/A |
gpt-5.5 |
5B | 200M | 50M | 90K | N/A |
GPT-OSS
| Modelo | Tokens por minuto (TPM) | Pedidos por minuto (RPM) |
|---|---|---|
gpt-oss-120b |
5 milhões | 5 K |
Níveis de utilização
As implementações de Global Standard utilizam a infraestrutura global do Azure. Eles encaminham dinamicamente o tráfego dos clientes para o centro de dados com a melhor disponibilidade para os pedidos de inferência do cliente. De forma semelhante, as implementações do Data Zone Standard permitem usar a infraestrutura global do Azure para encaminhar dinamicamente o tráfego para o data center dentro da zona de dados definida pela Microsoft, com a melhor disponibilidade para cada pedido. Esta prática permite uma latência mais consistente para clientes com níveis baixos a médios de tráfego. Clientes com níveis elevados de utilização sustentada podem observar maior variabilidade na latência de resposta.
Os níveis de utilização do Azure OpenAI foram concebidos para proporcionar desempenho consistente à maioria dos clientes com níveis baixos a médios de tráfego. Cada nível de utilização define o débito máximo (tokens por minuto) que se pode esperar com latência previsível. Quando o seu uso se mantém dentro do seu nível atribuído, a latência mantém-se estável e os tempos de resposta são consistentes.
O que acontece se ultrapassares o teu nível de utilização?
- Se a taxa de processamento do seu pedido exceder o seu nível de utilização — especialmente durante períodos de alta procura — a sua latência de resposta pode aumentar significativamente.
- A latência pode variar e, em alguns casos, pode ser mais do que o dobro do que ao operar dentro do seu escalão de utilização.
- Esta variabilidade é mais notória em clientes com uso sustentado elevado ou padrões de tráfego intermitente.
Ações recomendadas se excederes o teu nível de utilização
Se encontrar erros 429 ou notar um aumento da variabilidade na latência, siga os seguintes passos:
- Solicite um aumento de quota: visite o portal do Azure para solicitar uma quota maior para a sua subscrição.
- Considere atualizar para uma oferta premium (PTU): para cargas de trabalho críticas de latência ou de alto volume, atualize para Unidades de Débito Provisionadas (PTU). A PTU oferece recursos dedicados, capacidade garantida e latência previsível — mesmo em larga escala. Esta é a melhor escolha para aplicações críticas à missão que exigem desempenho consistente.
- Monitorize a sua utilização: reveja regularmente as métricas de utilização no portal do Azure para garantir que está a operar dentro dos seus limites de nível. Ajusta a tua carga de trabalho ou estratégia de implementação conforme necessário.
Poderá receber respostas 429 (Demasiados pedidos) mesmo quando as métricas de utilização de tokens pareçam estar abaixo da sua quota. Para uma explicação de por que motivo isto acontece, consulte Por que motivo poderá ver erros 429 mesmo quando as métricas de utilização de tokens estão abaixo do limite da quota.
O limite de utilização determina o nível de utilização acima do qual os clientes podem observar maior variabilidade na latência de resposta. O uso do cliente é definido por modelo. É o número total de tokens consumidos em todas as implementações, em todas as subscrições, em todas as regiões para um dado inquilino.
Nota
Os níveis de utilização aplicam-se apenas aos tipos de implementação Standard, Data Zone Standard e Global Standard. Os níveis de utilização não se aplicam a implementações globais em lote e largura de banda provisionada.
Padrão Global, Padrão de Zona de Dados e Padrão
| Modelo | Níveis de utilização por mês |
|---|---|
gpt-5 |
32 mil milhões de tokens |
gpt-5-mini |
160 mil milhões de tokens |
gpt-5-nano |
800 mil milhões de tokens |
gpt-5-chat |
32 mil milhões de tokens |
gpt-4
+
gpt-4-32k (todas as versões) |
6 mil milhões de tokens |
gpt-4o |
12 mil milhões de tokens |
gpt-4o-mini |
85 mil milhões de tokens |
o3-mini |
50 mil milhões de tokens |
o1 |
4 mil milhões de tokens |
o4-mini |
50 mil milhões de tokens |
o3 |
5 mil milhões de tokens |
gpt-4.1 |
30 mil milhões de tokens |
gpt-4.1-mini |
150 mil milhões de tokens |
gpt-4.1-nano |
550 mil milhões de tokens |
gpt-5.1 |
86 mil milhões de tokens |
gpt-5.1-codex |
86 mil milhões de tokens |
gpt-5.2 |
60 mil milhões de tokens |
gpt-5.3-codex |
60 mil milhões de tokens |
gpt-5.4 |
50 mil milhões de tokens |
gpt-5.4-mini |
165 mil milhões de tokens |
gpt-5.4-nano |
605 mil milhões de tokens |
gpt-5.5 |
25 mil milhões de tokens |
gpt-5.6-sol |
25 mil milhões de tokens |
Melhores práticas gerais para manter os limites de taxa
Para minimizar problemas relacionados com os limites de taxa, é aconselhável utilizar as seguintes técnicas:
- Implementa lógica de repetição na sua aplicação.
- Evite mudanças bruscas na carga de trabalho. Aumenta a carga de trabalho gradualmente.
- Testa diferentes padrões de aumento de carga.
- Aumente a quota atribuída à sua missão. Transferir quota de outra missão, se necessário.
Para obter boas práticas detalhadas, exemplos de código para repetição com intervalo progressivo e um guia de resolução de problemas do erro 429, consulte Manage Azure OpenAI in Microsoft Foundry Models quota.
Aumentos das quotas de pedidos
Submeta o formulário de pedido de aumento de quota para solicitar aumentos de quota para Modelos Foundry vendidos pela Azure, modelos do Azure OpenAI e modelos Anthropic. Exceto para modelos Anthropic, modelos de parceiros e comunidade não suportam aumentos de cotas.
Os pedidos de aumento de quotas são processados pela ordem em que são recebidos, e a prioridade vai para os clientes que utilizam ativamente a sua quota de alocação existente. Pedidos que não cumpram esta condição podem ser recusados.
Limites regionais de capacidade de quotas
Pode consultar a disponibilidade de quotas por região para a sua subscrição no portal da Foundry.
Para verificar quotas e capacidade programáticamente, consulte Verificação Programática de quotas e capacidade no guia de gestão de quotas. Essa secção abrange duas APIs REST complementares: a API de Utilizações para verificar o consumo em relação a limites, e a API de Capacidades de Modelo para verificar a capacidade de implementação disponível por modelo e região.
Nota
Atualmente, tanto o portal Foundry como as APIs de capacidade devolvem informações de quotas e capacidade para modelos que estão retirados e já não estão disponíveis para novas implementações.
Conteúdo relacionado
- Explore como gerir quotas para as suas implementações Azure OpenAI.
- Saiba mais sobre os modelos subjacentes que alimentam Azure OpenAI.