Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
Dieser Artikel enthält eine Kurzübersicht und eine detaillierte Beschreibung der Kontingente und Grenzwerte für Azure OpenAI.
Umfang des Kontingents
Kontingente und Begrenzungen gelten nicht auf Mandantenebene. Stattdessen wird die höchste Ebene der Kontingenteinschränkungen auf der Azure Abonnementebene festgelegt.
Kontingentverwaltung auf Abonnementebene
Important
Die Kontingentverwaltung auf Abonnementebene in Microsoft Foundry begann nach dem 7. Mai 2026.
Beginnend mit "Realtime Translate" und "Realtime Whisper" und bald allen Modellen verfolgt Foundry das Kontingent für Bereitstellungen auf Abonnementebene statt pro Ressource oder Region. Dieser Ansatz bringt Konsistenz und Vorhersagbarkeit dazu, wie das Kontingent über Bereitstellungen hinweg verwaltet wird, da alle Ressourcen und Regionen in einem Abonnement den gleichen Kontingentpool aufweisen.
Diese Änderung konsolidiert Quoten in gemeinsamen Pools.
- Globaler Standard: Bereitstellungen desselben Modells und derselben Version teilen einen Kontingentpool für alle Regionen in einem Abonnement.
- Data Zone Standard: Bereitstellungen desselben Modells und der Version teilen einen Kontingentpool pro Datenzone (z. B. USA oder EU).
Weitere Informationen zur Kontingentzuweisung auf Abonnementebene finden Sie unter Microsoft Kontingente und Grenzwerte für Foundry Models.
Kontingentstufen
Microsoft führt Kontingentebenen ein, um die Erfahrung der Foundry Models zu verbessern und die Reibung bei der Skalierung von Workloads zu verringern. Kontingente steigen jetzt automatisch mit der Nutzung, was dabei hilft, Fehler aufgrund von Ratenbegrenzungen zu vermeiden und gleichzeitig ein faireres Umfeld für alle Benutzer zu schaffen. Sieben Stufen sind verfügbar: die kostenlose Stufe und die Stufen 1 bis 6 – wobei Stufe 6 die höchsten Kontingente bietet. Die erste zugewiesene Stufe eines Kunden basiert auf der aktuellen Nutzung dieses Modells und seiner aktuellen Beziehung zu Microsoft, z. B. enterprise Agreement (EA oder MCA-E) Status.
Was ändert sich für mich?
Zuvor bot Foundry nur Standard- und Enterprise-Kontingentstufen für den Pay-as-you-go-Angebotstyp an, mit einem großen Abstand zwischen den jeweiligen Stufen und einem längeren Prozess zur Anforderung von Erhöhungen. Bei Kontingentstufen werden allen Benutzern eine Ebene mit Kontingenten zugewiesen, die gleich oder höher als ihre vorherigen Ebenen sind. Alle zuvor genehmigten Kontingenterhöhungen werden beibehalten und werden nicht reduziert. Da die Nutzung wächst, erhöht Foundry automatisch Kontingente, indem Benutzer auf höhere Ebenen verschoben werden, und zusätzliches Kontingent kann weiterhin über das Kontingentformular angefordert werden.
Wie wird ein Kunde automatisch von einer Ebene zu einer anderen wechseln, z. B. was sind die Ebenenänderungskriterien?
Automatische Upgrades auf eine höhere Stufe hängen in erster Linie vom Nutzungsverhalten der Kunden über die Zeit hinweg bei Foundry Models ab. Wenn die Nutzung eines Kunden so erhöht wird, dass seine aktuelle Kontingentebene ihre Fähigkeit zur Verwendung von Foundry Models begrenzt, aktualisiert das System den Kunden automatisch auf die nächste höhere Stufe. Das System betrachtet auch die Beziehung eines Kunden mit Microsoft. Kunden mit Enterprise-Beziehungen (einschließlich EA und MCA-E) mit Microsoft werden höheren Kontingentstufen zugewiesen. Darüber hinaus berücksichtigt Microsoft auch den Zahlungsverlauf eines Kunden, um die Berechtigung für automatische Upgrades zu ermitteln.
Kann ich automatische Upgrades deaktivieren?
Ja, Sie können automatische Upgrades deaktivieren, um unabhängig von Änderungen ihres Verbrauchs in Ihrer aktuellen Stufe zu bleiben. Einige Kunden verwenden das Kontingent, um ihre Abrechnung zu verwalten. Die Verwendung des Kontingents zum Verwalten der Abrechnung ist nicht die Azure bewährte Methode, aber wenn Ihr System auf diese Weise konfiguriert ist, sollten Sie es möglicherweise nicht unterbrechen. Weitere Informationen zum Abrechnungsmanagement und bewährten Methoden finden Sie unter Kostenverwaltung.
Um dies zu deaktivieren, können Sie die folgende Kennzeichnung auf NoAutoUpgrade festlegen:
curl -X PATCH \
"https://management.azure.com/subscriptions/00000000-0000-0000-0000-000000000000/providers/Microsoft.CognitiveServices/quotaTiers/default?api-version=2025-10-01-preview" \
-H "Authorization: Bearer <YOUR_ACCESS_TOKEN>" \
-H "Content-Type: application/json" \
-d '{
"properties": {
"tierUpgradePolicy": "NoAutoUpgrade"
}
}'
Hinweis
Das Feature "Abmelden" ist eine Vorschau und kann in Zukunft geändert/entfernt werden.
Kann ich mehr Kontingent anfordern?
Ja, mithilfe des Kontingentanforderungsformulars können Sie immer mehr Kontingent anfordern. Wenn die Anforderung genehmigt wurde, bleibt die aktuelle Ebene gleich, aber mit mehr zugewiesenem Kontingent.
Wie kann ich die Kontingentebene meines Abonnements überprüfen?
Sie können aktuell Ihre Kontingentebene mit der Control Plane-API überprüfen.
curl -X GET \
"https://management.azure.com/subscriptions/00000000-0000-0000-0000-000000000000/providers/Microsoft.CognitiveServices/quotaTiers?api-version=2025-10-01-preview" \
-H "Authorization: Bearer $(az account get-access-token --resource https://management.azure.com --query accessToken -o tsv)" \
-H "Content-Type: application/json"
Referenz für Quotenebene
Alle gpt-chat-latest Versionen verwenden den gleichen TPM-Grenzwert auf Ebene, der in jeder Ebene angezeigt wird. Versionen 2026-05-05, 2026-05-28, und 2026-06-241 verwenden 10 U/min je 1.000 TPM. Version 2026-08-062 verwendet 1 RPM pro 1.000 TPM, sodass die Tabellen die Versionen separat auflisten.
Ebene 1
| Modellname | Bereitstellungstyp | Anforderungen pro Minute (RPM) | Token pro Minute (TPM) |
|---|---|---|---|
| codex-mini | GlobalStandard | 1,000 | 1,000,000 |
| Computerverwendungsvorschau | GlobalStandard | 4,500 | 450.000 |
| gpt-4.1 | DataZoneStandard | 300 | 300,000 |
| gpt-4.1 | GlobalStandard | 1,000 | 1,000,000 |
| gpt-4.1-mini | DataZoneStandard | 2.000 | 2,000,000 |
| gpt-4.1-mini | GlobalStandard | 5,000 | 5,000,000 |
| gpt-4.1-mini | Standard | 6,000 | 6,000,000 |
| gpt-4.1-nano | DataZoneStandard | 2.000 | 2,000,000 |
| gpt-4.1-nano | GlobalStandard | 5,000 | 5,000,000 |
| gpt-4o | DataZoneStandard | 300 / 10 Sekunden | 300,000 |
| gpt-4o-Audio-Vorschau | GlobalStandard | 30000 / 10s | 30,000,000 |
| gpt-4o-mini | DataZoneStandard | 10.000 | 1,000,000 |
| gpt-4o-mini | GlobalStandard | 20,000 | 2,000,000 |
| gpt-4o-mini-Audio-Vorschau | GlobalStandard | 30000 / 10s | 30,000,000 |
| gpt-4o-mini-Echtzeit-Vorschau | GlobalStandard | 36 | 6,000 |
| gpt-4o-realtime-preview | GlobalStandard | 36 | 6,000 |
| gpt-5 | DataZoneStandard | 3,000 | 300,000 |
| gpt-5 | GlobalStandard | 10.000 | 1,000,000 |
| gpt-5-chat | GlobalStandard | 1,000 | 1,000,000 |
| gpt-5-codex | GlobalStandard | 1,000 | 1,000,000 |
| gpt-5-mini | DataZoneStandard | 300 | 300,000 |
| gpt-5-mini | GlobalStandard | 1,000 | 1,000,000 |
| gpt-5-nano | DataZoneStandard | 2.000 | 2,000,000 |
| gpt-5-nano | GlobalStandard | 5,000 | 5,000,000 |
| gpt-5-pro | GlobalStandard | 1,600 | 160,000 |
| gpt-5.1 | DataZoneStandard | 3,000 | 300,000 |
| gpt-5.1 | GlobalStandard | 10.000 | 1,000,000 |
| gpt-5.1 | Standard | 3,000 | 300,000 |
| gpt-5.1-chat | GlobalStandard | 10.000 | 1,000,000 |
| gpt-5.1-codex | DataZoneStandard | 3,000 | 300,000 |
| gpt-5.1-codex | GlobalStandard | 1,000 | 1,000,000 |
| gpt-5.1-codex-max | GlobalStandard | 10.000 | 1,000,000 |
| gpt-5.1-codex-mini | GlobalStandard | 1,000 | 1,000,000 |
| gpt-5.2 | DataZoneStandard | 3,000 | 300,000 |
| gpt-5.2 | GlobalStandard | 10.000 | 1,000,000 |
| gpt-5.2-chat | GlobalStandard | 10.000 | 1,000,000 |
| gpt-5.3-chat | GlobalStandard | 1,000 | 1,000,000 |
| gpt-5.2-codex | GlobalStandard | 10.000 | 1,000,000 |
| gpt-5.3-codex | GlobalStandard | 10.000 | 1,000,000 |
| gpt-5.4 | DataZoneStandard | 300 | 300,000 |
| gpt-5.4 | GlobalStandard | 10.000 | 1,000,000 |
| gpt-5.4-pro | GlobalStandard | 160 | 160,000 |
| gpt-5.4-mini | GlobalStandard | 1,000 | 1,000,000 |
| gpt-5.4-nano | DataZoneStandard | 2.000 | 2,000,000 |
| gpt-5.4-nano | GlobalStandard | 5,000 | 5,000,000 |
| gpt-5.5 | DataZoneStandard | 333 | 333,000 |
| gpt-5.5 | GlobalStandard | 1,000 | 1,000,000 |
| gpt-5.6-luna | DataZoneStandard | 333 | 333,000 |
| gpt-5.6-luna | GlobalStandard | 1,000 | 1,000,000 |
| gpt-5.6-sol | DataZoneStandard | 333 | 333,000 |
| gpt-5.6-sol | GlobalStandard | 1,000 | 1,000,000 |
| gpt-5.6-terra | DataZoneStandard | 333 | 333,000 |
| gpt-5.6-terra | GlobalStandard | 1,000 | 1,000,000 |
| gpt-chat-latest1 | GlobalStandard | 10.000 | 1,000,000 |
| gpt-chat-latest2 | GlobalStandard | 1,000 | 1,000,000 |
| gpt-audio | GlobalStandard | 30000 / 10s | 30,000,000 |
| gpt-image-1 | GlobalStandard | 9 | - |
| gpt-image-1-mini | GlobalStandard | 12 | - |
| gpt-image-1.5 | DataZoneStandard | 3 | - |
| gpt-image-1.5 | GlobalStandard | 9 | - |
| gpt-image-2 | DataZoneStandard | 2 | - |
| gpt-image-2 | GlobalStandard | 6 | - |
| gpt-Echtzeit | GlobalStandard | 200 | 100,000 |
| Model-Router | DataZoneStandard | 300 | 300,000 |
| Model-Router | GlobalStandard | 1,000 | 1,000,000 |
| O1 | DataZoneStandard | 100 | 600,000 |
| O1 | GlobalStandard | 500 | 3,000,000 |
| O3 | DataZoneStandard | 300 | 300,000 |
| O3 | GlobalStandard | 1,000 | 1,000,000 |
| o3-deep-research | GlobalStandard | 3,000 | 3,000,000 |
| o3-mini | DataZoneStandard | 200 | 2,000,000 |
| o3-mini | GlobalStandard | 500 | 5,000,000 |
| o3-pro | GlobalStandard | 160 | 1,600,000 |
| o4-mini | DataZoneStandard | 300 / 10 Sekunden | 300,000 |
| o4-mini | GlobalStandard | 1,000 | 1,000,000 |
| text-embedding-3-large | DataZoneStandard | 1,000 | 1,000,000 |
| text-embedding-3-large | GlobalStandard | 1000 / 10 Sekunden | 1,000,000 |
| text-embedding-3-small | DataZoneStandard | 1,000 | 1,000,000 |
| text-embedding-3-small | GlobalStandard | 1000 / 10 Sekunden | 1,000,000 |
Referenz zu Kontingenten und Grenzwerten
Im folgenden Abschnitt finden Sie eine Kurzanleitung zu den Standardkontingenten und Grenzwerten, die für Azure OpenAI gelten:
| Name des Grenzwerts | Grenzwert |
|---|---|
| Azure OpenAI-Ressourcen pro Azure-Abonnement | 30. |
| Standardmäßige GPT-image-1-Kontingentbeschränkungen | 9 Anforderungen pro Minute |
| Standardmäßige GPT-image-1-Mini-Kontingentbeschränkungen | 12 Anforderungen pro Minute |
| Standardmäßige GPT-image-1.5-Kontingentbeschränkungen | 9 Anforderungen pro Minute |
| Standardmäßige GPT-image-2-Kontingentbeschränkungen | 9 Anforderungen pro Minute |
| Standardmäßige Sora-Kontingentbeschränkungen | 60 Anforderungen pro Minute. |
| Standardmäßige Sora 2-Kontingentbeschränkungen | 2 Auftragsanfragen1 pro Minute |
| Standardgrenzwerte für Sprach-zu-Text-Audio-API | 3 Anforderungen pro Minute. |
| Maximale Anzahl der Prompt-Token pro Anforderung | Variiert je Modell. Weitere Informationen finden Sie unter Azure OpenAI-Modelle. |
| Maximale Standardbereitstellungen pro Ressource | 32. |
| Max. optimierte Modellbereitstellungen | 10. |
| Gesamtzahl der Schulungsaufträge pro Ressource | 100. |
| Maximale gleichzeitige Ausführung von Schulungsaufträgen pro Ressource | Standard- und globale Schulung: 3; Entwicklerschulung: 5 |
| Max. Anzahl von Trainingsaufträgen in der Warteschlange | 20. |
| Maximale Anzahl von Dateien pro Ressource (Feinabstimmung) | 100. |
| Gesamtgröße aller Dateien pro Ressource (Feinabstimmung) | 1 GB. |
| Maximale Schulungsarbeitszeit (Auftrag schlägt fehl, wenn überschritten) | 720 Stunden. |
Maximale Größe des Schulungsauftrags (tokens in training file) x (# of epochs) |
2 Mrd. |
| Maximale Größe aller Dateien pro Upload (Azure OpenAI auf Ihren Daten) | 16 MB. |
Maximale Anzahl von Eingaben in Arrays mit /embeddings |
2,048. |
Maximale Token pro /embeddings Anforderung (Summe für alle Eingaben) |
300,000. |
Maximale Anzahl von /chat/completions Nachrichten |
2,048. |
Maximale Anzahl von /chat/completions Funktionen |
128. |
Maximale Anzahl von /chat/completions Tools |
128. |
| Maximale Anzahl bereitgestellter Durchsatzeinheiten pro Bereitstellung | 100,000. |
| Maximale Anzahl von Dateien pro Assistent oder Thread | 10.000 bei Verwendung der API oder des Microsoft Foundry-Portals. |
| Maximale Dateigröße für Assistenten und Feinabstimmung | 512 MB über die API 200 MB über das Foundry-Portal. |
| Maximale Dateiuploadanforderungen pro Ressource | 30 Anforderungen pro Sekunde. |
| Maximale Größe für alle hochgeladenen Dateien für Assistenten | 200 GB. |
| Tokenlimit für Assistenten | 2.000.000 Token-Limit. |
GPT-4o und GPT-4.1 maximale Bilder pro Anforderung (Anzahl der Bilder im Nachrichtenarray oder Unterhaltungsverlauf) |
50. |
GPT-4 vision-preview und GPT-4 turbo-2024-04-09 standardmäßige maximale Token |
16. Erhöhen Sie den max_tokens Parameterwert, um abgeschnittene Antworten zu vermeiden.
GPT-4o Maximale Token sind standardmäßig auf 4.096 festgelegt. |
| Maximale Anzahl von benutzerdefinierten Headern in API-Anforderungen2 | 10. |
| Grenzwert für Nachrichtenzeichen | 1,048,576. |
| Nachrichtengröße für Audiodateien | 20 MB. |
1 Das Sora 2 RPM-Kontingent zählt nur Videoauftragsanforderungen. Andere Arten von Anfragen sind nicht ratenbeschränkt.
2 Unsere aktuellen APIs ermöglichen bis zu 10 benutzerdefinierte Header, die über die Pipeline übergeben und zurückgegeben werden. Einige Kunden überschreiten jetzt diese Headeranzahl, was zu HTTP 431-Fehlern führt. Für diesen Fehler gibt es keine Lösung, außer um die Kopfzeilenlautstärke zu reduzieren. In zukünftigen API-Versionen werden keine benutzerdefinierten Header übergeben. Es wird empfohlen, dass Kunden nicht von benutzerdefinierten Headern in zukünftigen Systemarchitekturen abhängen.
Hinweis
Kontingentbeschränkungen können geändert werden.
Batchgrenzwerte
| Name des Grenzwerts | Grenzwert |
|---|---|
| Maximale Batcheingabedateien (kein Ablauf) | 500 |
| Maximale Anzahl von Batch-Eingabedateien (Ablaufdatum festgelegt) | 10.000 |
| Maximale Größe der Eingabedatei | 200 MB |
| Maximale Größe der Eingabedatei – Bring your own storage (BYOS) | 1 GB |
| Maximale Anforderungen pro Datei | 100,000 |
Hinweis
Legen Sie fest, wann Eingabedateien ablaufen, um das Limit pro Ressource zu erhöhen und gespeicherte Dateien zu verwalten. Beschränkungen für Batch-Eingabedateien gelten nicht für Ausgabedateien wie result.jsonl und error.jsonl. Um Datei-API-Eingabedateibeschränkungen zu vermeiden, verwenden Sie Batch mit Azure Blob Storage.
Batch-Kontingent
Die Tabelle zeigt den Grenzwert für batchkontingente. Kontingentwerte für den globalen Batch werden in Bezug auf enqueuierte Token dargestellt. Wenn Sie eine Datei für die Batchverarbeitung übermitteln, wird die Anzahl der Token in der Datei gezählt. Bis der Batchauftrag einen endgültigen Status erreicht, werden diese Tokens auf Ihren Gesamtgrenzwert der Tokens in der Warteschlange angerechnet.
Globaler Stapel
| Modell | Unternehmen und MCA-E | Standard | Monatliche Kreditkartenabonnements | MSDN-Abonnements | Azure für Studenten, kostenlose Testversionen |
|---|---|---|---|---|---|
gpt-4.1 |
5B | 200M | 50M | 90K | N/A |
gpt-4.1 mini |
15B | 1B | 50M | 90K | N/A |
gpt-4.1-nano |
15B | 1B | 50M | 90K | N/A |
gpt-4o |
5B | 200M | 50M | 90K | N/A |
gpt-4o-mini |
15B | 1B | 50M | 90K | N/A |
gpt-4-turbo |
300 M | 80M | 40M | 90K | N/A |
gpt-4 |
150 Mio. | 30M | 5 Millionen | 100K | N/A |
o3-mini |
15B | 1B | 50M | 90K | N/A |
o4-mini |
15B | 1B | 50M | 90K | N/A |
gpt-5 |
5B | 200M | 50M | 90K | N/A |
gpt-5.1 |
5B | 200M | 50M | 90K | N/A |
gpt-5.2 |
5B | 200M | 50M | N/A | N/A |
gpt-5.4 |
5B | 200M | 50M | N/A | N/A |
gpt-5.4-mini |
5B | 200M | 50M | N/A | N/A |
gpt-5.4-nano |
5B | 200M | 50M | N/A | N/A |
gpt-5.5 |
5B | 200M | 50M | 90K | N/A |
B = Milliarde | M = Million | K = Tausend
Datenzonenbatch
| Modell | Unternehmen und MCA-E | Standard | Monatliche Kreditkartenabonnements | MSDN-Abonnements | Azure für Studenten, kostenlose Testversionen |
|---|---|---|---|---|---|
gpt-4.1 |
500 Millionen | 30M | 30M | 90K | N/A |
gpt-4.1-mini |
1,5 Mrd. | 100 Mio. | 50M | 90K | N/A |
gpt-4o |
500 Millionen | 30M | 30M | 90K | N/A |
gpt-4o-mini |
1,5 Mrd. | 100 Mio. | 50M | 90K | N/A |
o3-mini |
1,5 Mrd. | 100 Mio. | 50M | 90K | N/A |
gpt-5 |
5B | 200M | 50M | 90K | N/A |
gpt-5.1 |
5B | 200M | 50M | 90K | N/A |
gpt-5.4 |
5B | 200M | 50M | N/A | N/A |
gpt-5.4-mini |
5B | 200M | 50M | N/A | N/A |
gpt-5.5 |
5B | 200M | 50M | 90K | N/A |
gpt-oss
| Modell | Token pro Minute (TPM) | Anforderungen pro Minute (RPM) |
|---|---|---|
gpt-oss-120b |
5 Mio. | 5.000 |
Verwendungsebenen
Globale Standardbereitstellungen verwenden die globale Infrastruktur von Azure. Sie leiten den Kundendatenverkehr dynamisch an das Rechenzentrum weiter, wobei die beste Verfügbarkeit für die Rückschlussanforderungen des Kunden verfügbar ist. Ebenso ermöglichen Datenzonenstandardbereitstellungen die Verwendung der globalen Infrastruktur von Azure, um den Datenverkehr dynamisch an das Rechenzentrum innerhalb der Microsoft definierten Datenzone mit der besten Verfügbarkeit für jede Anforderung weiterzuleiten. Diese Vorgehensweise ermöglicht eine konsistentere Latenz für Kunden mit geringem bis mittlerem Datenverkehrsgrad. Kunden mit einem hohen dauerhaften Nutzungsgrad sehen möglicherweise eine größere Variabilität bei der Antwortlatenz.
Azure OpenAI-Nutzungsebenen sind darauf ausgelegt, für die meisten Kunden mit geringem bis mittlerem Datenverkehr eine konsistente Leistung zu bieten. Jede Verwendungsebene definiert den maximalen Durchsatz (Token pro Minute), den Sie mit vorhersagbarer Latenz erwarten können. Wenn Ihre Nutzung innerhalb der zugewiesenen Ebene verbleibt, bleibt die Latenz stabil, und die Reaktionszeiten sind konsistent.
Was geschieht, wenn Sie die Nutzungsstufe überschreiten?
- Wenn ihr Anforderungsdurchsatz Ihre Nutzungsebene überschreitet – insbesondere in Zeiträumen mit hoher Nachfrage – kann sich die Antwortlatenz erheblich erhöhen.
- Die Latenzzeit kann variieren und in einigen Fällen mehr als doppelt so hoch sein wie beim Betrieb innerhalb Ihres Tieres.
- Diese Variabilität ist für Kunden mit hohem kontinuierlichen Gebrauch oder stoßartigen Verkehrsmustern am deutlichsten.
Empfohlene Aktionen, wenn Sie die Nutzungsstufe überschreiten
Wenn 429 Fehler auftreten oder eine erhöhte Latenzvariabilität festgestellt wird, führen Sie die folgenden Schritte aus:
- Fordern Sie eine Kontingenterhöhung an: Besuchen Sie das Azure-Portal, um ein höheres Kontingent für Ihr Abonnement anzufordern.
- Erwägen Sie ein Upgrade auf ein Premium-Angebot (PTU): Für latenzenkritische oder hochvolumige Workloads, führen Sie ein Upgrade auf Bereitgestellte Durchsatzeinheiten (PTU) durch. PTU bietet dedizierte Ressourcen, garantierte Kapazität und vorhersehbare Latenz – auch in großem Umfang. Dies ist die beste Wahl für unternehmenskritische Anwendungen, die eine konsistente Leistung erfordern.
- Überwachen Sie Ihre Nutzung: Überprüfen Sie regelmäßig Ihre Nutzungsmetriken im Azure-Portal, um sicherzustellen, dass Sie innerhalb Ihrer Ebenengrenzwerte arbeiten. Passen Sie Ihre Workload- oder Bereitstellungsstrategie nach Bedarf an.
Möglicherweise erhalten Sie 429 (Zu viele Anforderungen) Antworten, auch wenn Tokenverwendungsmetriken unter Ihrem Kontingent angezeigt werden. Eine Erläuterung dazu, warum dies geschieht, finden Sie unter "Warum möglicherweise 429s angezeigt werden, auch wenn Tokennutzungsmetriken unter dem Kontingent liegen.
Der Nutzungsgrenzwert bestimmt den Umfang der Nutzung, über dem Kunden möglicherweise eine größere Variabilität bei der Antwortlatenz sehen können. Die Nutzung eines Kunden wird pro Modell definiert. Es ist die Gesamtanzahl der Token, die in allen Bereitstellungen in allen Abonnements in allen Regionen für einen bestimmten Mandanten verbraucht werden.
Hinweis
Verwendungsebenen gelten nur für Die Bereitstellungstypen "Standard", "Data Zone Standard" und "Global Standard". Nutzungsebenen gelten nicht für globale Batch-Bereitstellungen und bereitgestellte Durchsatzkapazitäten.
Globalstandard, Datenzonestandard und Standard
| Modell | Nutzungsstufen pro Monat |
|---|---|
gpt-5 |
32 Milliarden Token |
gpt-5-mini |
160 Milliarden Token |
gpt-5-nano |
800 Milliarden Token |
gpt-5-chat |
32 Milliarden Token |
gpt-4
+
gpt-4-32k (alle Versionen) |
6 Milliarden Token |
gpt-4o |
12 Milliarden Token |
gpt-4o-mini |
85 Milliarden Token |
o3-mini |
50 Milliarden Token |
o1 |
4 Milliarden Token |
o4-mini |
50 Milliarden Token |
o3 |
5 Milliarden Token |
gpt-4.1 |
30 Milliarden Token |
gpt-4.1-mini |
150 Milliarden Token |
gpt-4.1-nano |
550 Milliarden Token |
gpt-5.1 |
86 Milliarden Token |
gpt-5.1-codex |
86 Milliarden Token |
gpt-5.2 |
60 Milliarden Token |
gpt-5.3-codex |
60 Milliarden Token |
gpt-5.4 |
50 Milliarden Token |
gpt-5.4-mini |
165 Milliarden Token |
gpt-5.4-nano |
605 Milliarden Token |
gpt-5.5 |
25 Milliarden Token |
gpt-5.6-sol |
25 Milliarden Token |
Allgemeine bewährte Methoden, um innerhalb von Zinsgrenzwerten zu bleiben
Um Probleme im Zusammenhang mit Zinslimits zu minimieren, ist es ratsam, die folgenden Techniken zu verwenden:
- Implementieren Sie die Wiederholungslogik in Ihrer Anwendung.
- Vermeiden Sie scharfe Änderungen an der Arbeitsauslastung. Erhöhen Sie die Arbeitsauslastung schrittweise.
- Testen Sie unterschiedliche Auslastungserhöhungsmuster.
- Erhöhen Sie das Kontingent, das Ihrer Bereitstellung zugewiesen ist. Verschieben Sie das Kontingent bei Bedarf aus einer anderen Bereitstellung.
Ausführliche bewährte Methoden, Codebeispiele für Wiederholungen mit Backoff und eine Anleitung zur Fehlerbehebung bei 429-Fehlern finden Sie unter Verwalten des Azure OpenAI-Kontingents in Microsoft Foundry Models.
Anfordern von Kontingenterhöhungen
Übermitteln Sie das Formular für Kontingenterhöhungsanfragen, um Kontingenterhöhungen für von Azure vertriebene Foundry-Modelle, Azure OpenAI-Modelle und Anthropic-Modelle zu beantragen. Mit Ausnahme der Anthropic-Modelle unterstützen Modelle von Partnern und der Community keine Kontingenterhöhungen.
Kontingenterhöhungsanforderungen werden in der Reihenfolge verarbeitet, in der sie empfangen werden, und Priorität geht an Kunden, die ihre vorhandene Kontingentzuweisung aktiv verwenden. Anforderungen, die diese Bedingung nicht erfüllen, werden möglicherweise verweigert.
Regionale Kapazitätsgrenzen für Kontingente
Sie können die Verfügbarkeit von Kontingenten nach Region für Ihr Abonnement im Foundry-Portal anzeigen.
Informationen zum programmgesteuerten Überprüfen von Kontingenten und Kapazität finden Sie unter Programmgesteuertes Überprüfen des Kontingents und der Kapazität im Kontingentverwaltungshandbuch. Dieser Abschnitt befasst sich mit zwei ergänzenden REST-APIs: der Verwendungs-API für die Überprüfung des Verbrauchs anhand von Grenzwerten und der Modellkapazitäts-API zur Überprüfung der verfügbaren Bereitstellungskapazität nach Modell und Region.
Hinweis
Derzeit geben sowohl das Foundry-Portal als auch die Kapazitäts-APIs Informationen zu Kontingenten und Kapazitäten für Modelle zurück, die außer Dienst gestellt sind und für neue Bereitstellungen nicht mehr verfügbar sind.
Verwandte Inhalte
- Erfahren Sie, wie Sie Kontingent für Ihre Azure OpenAI-Bereitstellungen verwalten.
- Erfahren Sie mehr über die zugrundeliegenden Modelle, die Azure OpenAI antreiben.