Azure OpenAI in Microsoft Foundry-Modelle Kontingenten und Grenzwerte

Dieser Artikel enthält eine Kurzübersicht und eine detaillierte Beschreibung der Kontingente und Grenzwerte für Azure OpenAI.

Umfang des Kontingents

Kontingente und Begrenzungen gelten nicht auf Mandantenebene. Stattdessen wird die höchste Ebene der Kontingenteinschränkungen auf der Azure Abonnementebene festgelegt.

Kontingentverwaltung auf Abonnementebene

Important

Die Kontingentverwaltung auf Abonnementebene in Microsoft Foundry begann nach dem 7. Mai 2026.

Beginnend mit "Realtime Translate" und "Realtime Whisper" und bald allen Modellen verfolgt Foundry das Kontingent für Bereitstellungen auf Abonnementebene statt pro Ressource oder Region. Dieser Ansatz bringt Konsistenz und Vorhersagbarkeit dazu, wie das Kontingent über Bereitstellungen hinweg verwaltet wird, da alle Ressourcen und Regionen in einem Abonnement den gleichen Kontingentpool aufweisen.

Diese Änderung konsolidiert Quoten in gemeinsamen Pools.

  • Globaler Standard: Bereitstellungen desselben Modells und derselben Version teilen einen Kontingentpool für alle Regionen in einem Abonnement.
  • Data Zone Standard: Bereitstellungen desselben Modells und der Version teilen einen Kontingentpool pro Datenzone (z. B. USA oder EU).

Weitere Informationen zur Kontingentzuweisung auf Abonnementebene finden Sie unter Microsoft Kontingente und Grenzwerte für Foundry Models.

Kontingentstufen

Microsoft führt Kontingentebenen ein, um die Erfahrung der Foundry Models zu verbessern und die Reibung bei der Skalierung von Workloads zu verringern. Kontingente steigen jetzt automatisch mit der Nutzung, was dabei hilft, Fehler aufgrund von Ratenbegrenzungen zu vermeiden und gleichzeitig ein faireres Umfeld für alle Benutzer zu schaffen. Sieben Stufen sind verfügbar: die kostenlose Stufe und die Stufen 1 bis 6 – wobei Stufe 6 die höchsten Kontingente bietet. Die erste zugewiesene Stufe eines Kunden basiert auf der aktuellen Nutzung dieses Modells und seiner aktuellen Beziehung zu Microsoft, z. B. enterprise Agreement (EA oder MCA-E) Status. 

Was ändert sich für mich?

Zuvor bot Foundry nur Standard- und Enterprise-Kontingentstufen für den Pay-as-you-go-Angebotstyp an, mit einem großen Abstand zwischen den jeweiligen Stufen und einem längeren Prozess zur Anforderung von Erhöhungen. Bei Kontingentstufen werden allen Benutzern eine Ebene mit Kontingenten zugewiesen, die gleich oder höher als ihre vorherigen Ebenen sind. Alle zuvor genehmigten Kontingenterhöhungen werden beibehalten und werden nicht reduziert. Da die Nutzung wächst, erhöht Foundry automatisch Kontingente, indem Benutzer auf höhere Ebenen verschoben werden, und zusätzliches Kontingent kann weiterhin über das Kontingentformular angefordert werden.

Wie wird ein Kunde automatisch von einer Ebene zu einer anderen wechseln, z. B. was sind die Ebenenänderungskriterien? 

Automatische Upgrades auf eine höhere Stufe hängen in erster Linie vom Nutzungsverhalten der Kunden über die Zeit hinweg bei Foundry Models ab. Wenn die Nutzung eines Kunden so erhöht wird, dass seine aktuelle Kontingentebene ihre Fähigkeit zur Verwendung von Foundry Models begrenzt, aktualisiert das System den Kunden automatisch auf die nächste höhere Stufe. Das System betrachtet auch die Beziehung eines Kunden mit Microsoft. Kunden mit Enterprise-Beziehungen (einschließlich EA und MCA-E) mit Microsoft werden höheren Kontingentstufen zugewiesen. Darüber hinaus berücksichtigt Microsoft auch den Zahlungsverlauf eines Kunden, um die Berechtigung für automatische Upgrades zu ermitteln. 

Kann ich automatische Upgrades deaktivieren?

Ja, Sie können automatische Upgrades deaktivieren, um unabhängig von Änderungen ihres Verbrauchs in Ihrer aktuellen Stufe zu bleiben. Einige Kunden verwenden das Kontingent, um ihre Abrechnung zu verwalten. Die Verwendung des Kontingents zum Verwalten der Abrechnung ist nicht die Azure bewährte Methode, aber wenn Ihr System auf diese Weise konfiguriert ist, sollten Sie es möglicherweise nicht unterbrechen. Weitere Informationen zum Abrechnungsmanagement und bewährten Methoden finden Sie unter Kostenverwaltung.

Um dies zu deaktivieren, können Sie die folgende Kennzeichnung auf NoAutoUpgrade festlegen:

curl -X PATCH \
  "https://management.azure.com/subscriptions/00000000-0000-0000-0000-000000000000/providers/Microsoft.CognitiveServices/quotaTiers/default?api-version=2025-10-01-preview" \
  -H "Authorization: Bearer <YOUR_ACCESS_TOKEN>" \
  -H "Content-Type: application/json" \
  -d '{
    "properties": {
      "tierUpgradePolicy": "NoAutoUpgrade"
    }
  }'

Hinweis

Das Feature "Abmelden" ist eine Vorschau und kann in Zukunft geändert/entfernt werden.

Kann ich mehr Kontingent anfordern?

Ja, mithilfe des Kontingentanforderungsformulars können Sie immer mehr Kontingent anfordern. Wenn die Anforderung genehmigt wurde, bleibt die aktuelle Ebene gleich, aber mit mehr zugewiesenem Kontingent.

Wie kann ich die Kontingentebene meines Abonnements überprüfen?

Sie können aktuell Ihre Kontingentebene mit der Control Plane-API überprüfen.

curl -X GET \
  "https://management.azure.com/subscriptions/00000000-0000-0000-0000-000000000000/providers/Microsoft.CognitiveServices/quotaTiers?api-version=2025-10-01-preview" \
  -H "Authorization: Bearer $(az account get-access-token --resource https://management.azure.com --query accessToken -o tsv)" \
  -H "Content-Type: application/json"

Referenz für Quotenebene

Alle gpt-chat-latest Versionen verwenden den gleichen TPM-Grenzwert auf Ebene, der in jeder Ebene angezeigt wird. Versionen 2026-05-05, 2026-05-28, und 2026-06-241 verwenden 10 U/min je 1.000 TPM. Version 2026-08-062 verwendet 1 RPM pro 1.000 TPM, sodass die Tabellen die Versionen separat auflisten.

Ebene 1

Modellname Bereitstellungstyp Anforderungen pro Minute (RPM) Token pro Minute (TPM)
codex-mini GlobalStandard 1,000 1,000,000
Computerverwendungsvorschau GlobalStandard 4,500 450.000
gpt-4.1 DataZoneStandard 300 300,000
gpt-4.1 GlobalStandard 1,000 1,000,000
gpt-4.1-mini DataZoneStandard 2.000 2,000,000
gpt-4.1-mini GlobalStandard 5,000 5,000,000
gpt-4.1-mini Standard 6,000 6,000,000
gpt-4.1-nano DataZoneStandard 2.000 2,000,000
gpt-4.1-nano GlobalStandard 5,000 5,000,000
gpt-4o DataZoneStandard 300 / 10 Sekunden 300,000
gpt-4o-Audio-Vorschau GlobalStandard 30000 / 10s 30,000,000
gpt-4o-mini DataZoneStandard 10.000 1,000,000
gpt-4o-mini GlobalStandard 20,000 2,000,000
gpt-4o-mini-Audio-Vorschau GlobalStandard 30000 / 10s 30,000,000
gpt-4o-mini-Echtzeit-Vorschau GlobalStandard 36 6,000
gpt-4o-realtime-preview GlobalStandard 36 6,000
gpt-5 DataZoneStandard 3,000 300,000
gpt-5 GlobalStandard 10.000 1,000,000
gpt-5-chat GlobalStandard 1,000 1,000,000
gpt-5-codex GlobalStandard 1,000 1,000,000
gpt-5-mini DataZoneStandard 300 300,000
gpt-5-mini GlobalStandard 1,000 1,000,000
gpt-5-nano DataZoneStandard 2.000 2,000,000
gpt-5-nano GlobalStandard 5,000 5,000,000
gpt-5-pro GlobalStandard 1,600 160,000
gpt-5.1 DataZoneStandard 3,000 300,000
gpt-5.1 GlobalStandard 10.000 1,000,000
gpt-5.1 Standard 3,000 300,000
gpt-5.1-chat GlobalStandard 10.000 1,000,000
gpt-5.1-codex DataZoneStandard 3,000 300,000
gpt-5.1-codex GlobalStandard 1,000 1,000,000
gpt-5.1-codex-max GlobalStandard 10.000 1,000,000
gpt-5.1-codex-mini GlobalStandard 1,000 1,000,000
gpt-5.2 DataZoneStandard 3,000 300,000
gpt-5.2 GlobalStandard 10.000 1,000,000
gpt-5.2-chat GlobalStandard 10.000 1,000,000
gpt-5.3-chat GlobalStandard 1,000 1,000,000
gpt-5.2-codex GlobalStandard 10.000 1,000,000
gpt-5.3-codex GlobalStandard 10.000 1,000,000
gpt-5.4 DataZoneStandard 300 300,000
gpt-5.4 GlobalStandard 10.000 1,000,000
gpt-5.4-pro GlobalStandard 160 160,000
gpt-5.4-mini GlobalStandard 1,000 1,000,000
gpt-5.4-nano DataZoneStandard 2.000 2,000,000
gpt-5.4-nano GlobalStandard 5,000 5,000,000
gpt-5.5 DataZoneStandard 333 333,000
gpt-5.5 GlobalStandard 1,000 1,000,000
gpt-5.6-luna DataZoneStandard 333 333,000
gpt-5.6-luna GlobalStandard 1,000 1,000,000
gpt-5.6-sol DataZoneStandard 333 333,000
gpt-5.6-sol GlobalStandard 1,000 1,000,000
gpt-5.6-terra DataZoneStandard 333 333,000
gpt-5.6-terra GlobalStandard 1,000 1,000,000
gpt-chat-latest1 GlobalStandard 10.000 1,000,000
gpt-chat-latest2 GlobalStandard 1,000 1,000,000
gpt-audio GlobalStandard 30000 / 10s 30,000,000
gpt-image-1 GlobalStandard 9 -
gpt-image-1-mini GlobalStandard 12 -
gpt-image-1.5 DataZoneStandard 3 -
gpt-image-1.5 GlobalStandard 9 -
gpt-image-2 DataZoneStandard 2 -
gpt-image-2 GlobalStandard 6 -
gpt-Echtzeit GlobalStandard 200 100,000
Model-Router DataZoneStandard 300 300,000
Model-Router GlobalStandard 1,000 1,000,000
O1 DataZoneStandard 100 600,000
O1 GlobalStandard 500 3,000,000
O3 DataZoneStandard 300 300,000
O3 GlobalStandard 1,000 1,000,000
o3-deep-research GlobalStandard 3,000 3,000,000
o3-mini DataZoneStandard 200 2,000,000
o3-mini GlobalStandard 500 5,000,000
o3-pro GlobalStandard 160 1,600,000
o4-mini DataZoneStandard 300 / 10 Sekunden 300,000
o4-mini GlobalStandard 1,000 1,000,000
text-embedding-3-large DataZoneStandard 1,000 1,000,000
text-embedding-3-large GlobalStandard 1000 / 10 Sekunden 1,000,000
text-embedding-3-small DataZoneStandard 1,000 1,000,000
text-embedding-3-small GlobalStandard 1000 / 10 Sekunden 1,000,000

Referenz zu Kontingenten und Grenzwerten

Im folgenden Abschnitt finden Sie eine Kurzanleitung zu den Standardkontingenten und Grenzwerten, die für Azure OpenAI gelten:

Name des Grenzwerts Grenzwert
Azure OpenAI-Ressourcen pro Azure-Abonnement 30.
Standardmäßige GPT-image-1-Kontingentbeschränkungen 9 Anforderungen pro Minute
Standardmäßige GPT-image-1-Mini-Kontingentbeschränkungen 12 Anforderungen pro Minute
Standardmäßige GPT-image-1.5-Kontingentbeschränkungen 9 Anforderungen pro Minute
Standardmäßige GPT-image-2-Kontingentbeschränkungen 9 Anforderungen pro Minute
Standardmäßige Sora-Kontingentbeschränkungen 60 Anforderungen pro Minute.
Standardmäßige Sora 2-Kontingentbeschränkungen 2 Auftragsanfragen1 pro Minute
Standardgrenzwerte für Sprach-zu-Text-Audio-API 3 Anforderungen pro Minute.
Maximale Anzahl der Prompt-Token pro Anforderung Variiert je Modell. Weitere Informationen finden Sie unter Azure OpenAI-Modelle.
Maximale Standardbereitstellungen pro Ressource 32.
Max. optimierte Modellbereitstellungen 10.
Gesamtzahl der Schulungsaufträge pro Ressource 100.
Maximale gleichzeitige Ausführung von Schulungsaufträgen pro Ressource Standard- und globale Schulung: 3;
Entwicklerschulung: 5
Max. Anzahl von Trainingsaufträgen in der Warteschlange 20.
Maximale Anzahl von Dateien pro Ressource (Feinabstimmung) 100.
Gesamtgröße aller Dateien pro Ressource (Feinabstimmung) 1 GB.
Maximale Schulungsarbeitszeit (Auftrag schlägt fehl, wenn überschritten) 720 Stunden.
Maximale Größe des Schulungsauftrags (tokens in training file) x (# of epochs) 2 Mrd.
Maximale Größe aller Dateien pro Upload (Azure OpenAI auf Ihren Daten) 16 MB.
Maximale Anzahl von Eingaben in Arrays mit /embeddings 2,048.
Maximale Token pro /embeddings Anforderung (Summe für alle Eingaben) 300,000.
Maximale Anzahl von /chat/completions Nachrichten 2,048.
Maximale Anzahl von /chat/completions Funktionen 128.
Maximale Anzahl von /chat/completions Tools 128.
Maximale Anzahl bereitgestellter Durchsatzeinheiten pro Bereitstellung 100,000.
Maximale Anzahl von Dateien pro Assistent oder Thread 10.000 bei Verwendung der API oder des Microsoft Foundry-Portals.
Maximale Dateigröße für Assistenten und Feinabstimmung 512 MB über die API

200 MB über das Foundry-Portal.
Maximale Dateiuploadanforderungen pro Ressource 30 Anforderungen pro Sekunde.
Maximale Größe für alle hochgeladenen Dateien für Assistenten 200 GB.
Tokenlimit für Assistenten 2.000.000 Token-Limit.
GPT-4o und GPT-4.1 maximale Bilder pro Anforderung (Anzahl der Bilder im Nachrichtenarray oder Unterhaltungsverlauf) 50.
GPT-4 vision-preview und GPT-4 turbo-2024-04-09 standardmäßige maximale Token 16.

Erhöhen Sie den max_tokens Parameterwert, um abgeschnittene Antworten zu vermeiden. GPT-4o Maximale Token sind standardmäßig auf 4.096 festgelegt.
Maximale Anzahl von benutzerdefinierten Headern in API-Anforderungen2 10.
Grenzwert für Nachrichtenzeichen 1,048,576.
Nachrichtengröße für Audiodateien 20 MB.

1 Das Sora 2 RPM-Kontingent zählt nur Videoauftragsanforderungen. Andere Arten von Anfragen sind nicht ratenbeschränkt.

2 Unsere aktuellen APIs ermöglichen bis zu 10 benutzerdefinierte Header, die über die Pipeline übergeben und zurückgegeben werden. Einige Kunden überschreiten jetzt diese Headeranzahl, was zu HTTP 431-Fehlern führt. Für diesen Fehler gibt es keine Lösung, außer um die Kopfzeilenlautstärke zu reduzieren. In zukünftigen API-Versionen werden keine benutzerdefinierten Header übergeben. Es wird empfohlen, dass Kunden nicht von benutzerdefinierten Headern in zukünftigen Systemarchitekturen abhängen.

Hinweis

Kontingentbeschränkungen können geändert werden.

Batchgrenzwerte

Name des Grenzwerts Grenzwert
Maximale Batcheingabedateien (kein Ablauf) 500
Maximale Anzahl von Batch-Eingabedateien (Ablaufdatum festgelegt) 10.000
Maximale Größe der Eingabedatei 200 MB
Maximale Größe der Eingabedatei – Bring your own storage (BYOS) 1 GB
Maximale Anforderungen pro Datei 100,000

Hinweis

Legen Sie fest, wann Eingabedateien ablaufen, um das Limit pro Ressource zu erhöhen und gespeicherte Dateien zu verwalten. Beschränkungen für Batch-Eingabedateien gelten nicht für Ausgabedateien wie result.jsonl und error.jsonl. Um Datei-API-Eingabedateibeschränkungen zu vermeiden, verwenden Sie Batch mit Azure Blob Storage.

Batch-Kontingent

Die Tabelle zeigt den Grenzwert für batchkontingente. Kontingentwerte für den globalen Batch werden in Bezug auf enqueuierte Token dargestellt. Wenn Sie eine Datei für die Batchverarbeitung übermitteln, wird die Anzahl der Token in der Datei gezählt. Bis der Batchauftrag einen endgültigen Status erreicht, werden diese Tokens auf Ihren Gesamtgrenzwert der Tokens in der Warteschlange angerechnet.

Globaler Stapel

Modell Unternehmen und MCA-E Standard Monatliche Kreditkartenabonnements MSDN-Abonnements Azure für Studenten, kostenlose Testversionen
gpt-4.1 5B 200M 50M 90K N/A
gpt-4.1 mini 15B 1B 50M 90K N/A
gpt-4.1-nano 15B 1B 50M 90K N/A
gpt-4o 5B 200M 50M 90K N/A
gpt-4o-mini 15B 1B 50M 90K N/A
gpt-4-turbo 300 M 80M 40M 90K N/A
gpt-4 150 Mio. 30M 5 Millionen 100K N/A
o3-mini 15B 1B 50M 90K N/A
o4-mini 15B 1B 50M 90K N/A
gpt-5 5B 200M 50M 90K N/A
gpt-5.1 5B 200M 50M 90K N/A
gpt-5.2 5B 200M 50M N/A N/A
gpt-5.4 5B 200M 50M N/A N/A
gpt-5.4-mini 5B 200M 50M N/A N/A
gpt-5.4-nano 5B 200M 50M N/A N/A
gpt-5.5 5B 200M 50M 90K N/A

B = Milliarde | M = Million | K = Tausend

Datenzonenbatch

Modell Unternehmen und MCA-E Standard Monatliche Kreditkartenabonnements MSDN-Abonnements Azure für Studenten, kostenlose Testversionen
gpt-4.1 500 Millionen 30M 30M 90K N/A
gpt-4.1-mini 1,5 Mrd. 100 Mio. 50M 90K N/A
gpt-4o 500 Millionen 30M 30M 90K N/A
gpt-4o-mini 1,5 Mrd. 100 Mio. 50M 90K N/A
o3-mini 1,5 Mrd. 100 Mio. 50M 90K N/A
gpt-5 5B 200M 50M 90K N/A
gpt-5.1 5B 200M 50M 90K N/A
gpt-5.4 5B 200M 50M N/A N/A
gpt-5.4-mini 5B 200M 50M N/A N/A
gpt-5.5 5B 200M 50M 90K N/A

gpt-oss

Modell Token pro Minute (TPM) Anforderungen pro Minute (RPM)
gpt-oss-120b 5 Mio. 5.000

Verwendungsebenen

Globale Standardbereitstellungen verwenden die globale Infrastruktur von Azure. Sie leiten den Kundendatenverkehr dynamisch an das Rechenzentrum weiter, wobei die beste Verfügbarkeit für die Rückschlussanforderungen des Kunden verfügbar ist. Ebenso ermöglichen Datenzonenstandardbereitstellungen die Verwendung der globalen Infrastruktur von Azure, um den Datenverkehr dynamisch an das Rechenzentrum innerhalb der Microsoft definierten Datenzone mit der besten Verfügbarkeit für jede Anforderung weiterzuleiten. Diese Vorgehensweise ermöglicht eine konsistentere Latenz für Kunden mit geringem bis mittlerem Datenverkehrsgrad. Kunden mit einem hohen dauerhaften Nutzungsgrad sehen möglicherweise eine größere Variabilität bei der Antwortlatenz.

Azure OpenAI-Nutzungsebenen sind darauf ausgelegt, für die meisten Kunden mit geringem bis mittlerem Datenverkehr eine konsistente Leistung zu bieten. Jede Verwendungsebene definiert den maximalen Durchsatz (Token pro Minute), den Sie mit vorhersagbarer Latenz erwarten können. Wenn Ihre Nutzung innerhalb der zugewiesenen Ebene verbleibt, bleibt die Latenz stabil, und die Reaktionszeiten sind konsistent.

Was geschieht, wenn Sie die Nutzungsstufe überschreiten?

  • Wenn ihr Anforderungsdurchsatz Ihre Nutzungsebene überschreitet – insbesondere in Zeiträumen mit hoher Nachfrage – kann sich die Antwortlatenz erheblich erhöhen.
  • Die Latenzzeit kann variieren und in einigen Fällen mehr als doppelt so hoch sein wie beim Betrieb innerhalb Ihres Tieres.
  • Diese Variabilität ist für Kunden mit hohem kontinuierlichen Gebrauch oder stoßartigen Verkehrsmustern am deutlichsten.

Wenn 429 Fehler auftreten oder eine erhöhte Latenzvariabilität festgestellt wird, führen Sie die folgenden Schritte aus:

  • Fordern Sie eine Kontingenterhöhung an: Besuchen Sie das Azure-Portal, um ein höheres Kontingent für Ihr Abonnement anzufordern.
  • Erwägen Sie ein Upgrade auf ein Premium-Angebot (PTU): Für latenzenkritische oder hochvolumige Workloads, führen Sie ein Upgrade auf Bereitgestellte Durchsatzeinheiten (PTU) durch. PTU bietet dedizierte Ressourcen, garantierte Kapazität und vorhersehbare Latenz – auch in großem Umfang. Dies ist die beste Wahl für unternehmenskritische Anwendungen, die eine konsistente Leistung erfordern.
  • Überwachen Sie Ihre Nutzung: Überprüfen Sie regelmäßig Ihre Nutzungsmetriken im Azure-Portal, um sicherzustellen, dass Sie innerhalb Ihrer Ebenengrenzwerte arbeiten. Passen Sie Ihre Workload- oder Bereitstellungsstrategie nach Bedarf an.

Möglicherweise erhalten Sie 429 (Zu viele Anforderungen) Antworten, auch wenn Tokenverwendungsmetriken unter Ihrem Kontingent angezeigt werden. Eine Erläuterung dazu, warum dies geschieht, finden Sie unter "Warum möglicherweise 429s angezeigt werden, auch wenn Tokennutzungsmetriken unter dem Kontingent liegen.

Der Nutzungsgrenzwert bestimmt den Umfang der Nutzung, über dem Kunden möglicherweise eine größere Variabilität bei der Antwortlatenz sehen können. Die Nutzung eines Kunden wird pro Modell definiert. Es ist die Gesamtanzahl der Token, die in allen Bereitstellungen in allen Abonnements in allen Regionen für einen bestimmten Mandanten verbraucht werden.

Hinweis

Verwendungsebenen gelten nur für Die Bereitstellungstypen "Standard", "Data Zone Standard" und "Global Standard". Nutzungsebenen gelten nicht für globale Batch-Bereitstellungen und bereitgestellte Durchsatzkapazitäten.

Globalstandard, Datenzonestandard und Standard

Modell Nutzungsstufen pro Monat
gpt-5 32 Milliarden Token
gpt-5-mini 160 Milliarden Token
gpt-5-nano 800 Milliarden Token
gpt-5-chat 32 Milliarden Token
gpt-4 + gpt-4-32k (alle Versionen) 6 Milliarden Token
gpt-4o 12 Milliarden Token
gpt-4o-mini 85 Milliarden Token
o3-mini 50 Milliarden Token
o1 4 Milliarden Token
o4-mini 50 Milliarden Token
o3 5 Milliarden Token
gpt-4.1 30 Milliarden Token
gpt-4.1-mini 150 Milliarden Token
gpt-4.1-nano 550 Milliarden Token
gpt-5.1 86 Milliarden Token
gpt-5.1-codex 86 Milliarden Token
gpt-5.2 60 Milliarden Token
gpt-5.3-codex 60 Milliarden Token
gpt-5.4 50 Milliarden Token
gpt-5.4-mini 165 Milliarden Token
gpt-5.4-nano 605 Milliarden Token
gpt-5.5 25 Milliarden Token
gpt-5.6-sol 25 Milliarden Token

Allgemeine bewährte Methoden, um innerhalb von Zinsgrenzwerten zu bleiben

Um Probleme im Zusammenhang mit Zinslimits zu minimieren, ist es ratsam, die folgenden Techniken zu verwenden:

  • Implementieren Sie die Wiederholungslogik in Ihrer Anwendung.
  • Vermeiden Sie scharfe Änderungen an der Arbeitsauslastung. Erhöhen Sie die Arbeitsauslastung schrittweise.
  • Testen Sie unterschiedliche Auslastungserhöhungsmuster.
  • Erhöhen Sie das Kontingent, das Ihrer Bereitstellung zugewiesen ist. Verschieben Sie das Kontingent bei Bedarf aus einer anderen Bereitstellung.

Ausführliche bewährte Methoden, Codebeispiele für Wiederholungen mit Backoff und eine Anleitung zur Fehlerbehebung bei 429-Fehlern finden Sie unter Verwalten des Azure OpenAI-Kontingents in Microsoft Foundry Models.

Anfordern von Kontingenterhöhungen

Übermitteln Sie das Formular für Kontingenterhöhungsanfragen, um Kontingenterhöhungen für von Azure vertriebene Foundry-Modelle, Azure OpenAI-Modelle und Anthropic-Modelle zu beantragen. Mit Ausnahme der Anthropic-Modelle unterstützen Modelle von Partnern und der Community keine Kontingenterhöhungen.

Kontingenterhöhungsanforderungen werden in der Reihenfolge verarbeitet, in der sie empfangen werden, und Priorität geht an Kunden, die ihre vorhandene Kontingentzuweisung aktiv verwenden. Anforderungen, die diese Bedingung nicht erfüllen, werden möglicherweise verweigert.

Regionale Kapazitätsgrenzen für Kontingente

Sie können die Verfügbarkeit von Kontingenten nach Region für Ihr Abonnement im Foundry-Portal anzeigen.

Informationen zum programmgesteuerten Überprüfen von Kontingenten und Kapazität finden Sie unter Programmgesteuertes Überprüfen des Kontingents und der Kapazität im Kontingentverwaltungshandbuch. Dieser Abschnitt befasst sich mit zwei ergänzenden REST-APIs: der Verwendungs-API für die Überprüfung des Verbrauchs anhand von Grenzwerten und der Modellkapazitäts-API zur Überprüfung der verfügbaren Bereitstellungskapazität nach Modell und Region.

Hinweis

Derzeit geben sowohl das Foundry-Portal als auch die Kapazitäts-APIs Informationen zu Kontingenten und Kapazitäten für Modelle zurück, die außer Dienst gestellt sind und für neue Bereitstellungen nicht mehr verfügbar sind.