Tipi di distribuzione per Microsoft modelli Foundry

Quando si distribuisce un modello in Microsoft Foundry, si sceglie un tipo di distribuzione che determina:

  • Posizione in cui vengono elaborati i dati (globale, zona dati o singola area)
  • Modalità di pagamento (pagamento per token o capacità riservata)
  • Caratteristiche delle prestazioni (varianza della latenza, limiti di velocità effettiva)

Questi tipi di distribuzione si applicano all'opzione di distribuzione API serverless . I modelli open source e personalizzati che usano il calcolo gestito non usano questi tipi. Per informazioni sulle differenze tra le opzioni, vedere Panoramica della distribuzione per Microsoft Modelli Foundry.

Il servizio offre tre categorie principali: standard (pagamento per token), provisioning (capacità riservata) e batch (elaborazione asincrona scontata). È disponibile anche un tipo di sviluppatore per la valutazione del modello ottimizzata. All'interno delle categorie standard e con provisioning, è possibile scegliere l'elaborazione globale, della zona dati o dell'area in base ai requisiti di conformità.

Suggerimento

Non è sempre necessario creare una distribuzione. Con l'accesso immediato (anteprima) è possibile chiamare i modelli supportati in base al nome e avviare immediatamente l'esecuzione dell'inferenza, senza che sia necessaria alcuna distribuzione.

Screenshot della finestra di dialogo di distribuzione del portale Foundry che mostra la casella di selezione del tipo di distribuzione con l'opzione Standard globale selezionata.

Importante

Residenza dei dati per tutti i tipi di distribuzione: i dati archiviati inattivi rimangono nell'area geografica Azure designata. Tuttavia, l'elaborazione dei dati a fini inferenziali viene eseguita come segue:

  • tipi di Global: possono essere elaborati in qualsiasi area Azure
  • Tipi di zona dati: il servizio elabora i dati solo all'interno della zona dati specificata Microsoft (Stati Uniti, UE o Asia Pacifico)).
  • Tipi standard (singola area): il servizio elabora i dati nell'area di distribuzione.

Altre informazioni sulla residenza dei dati.

Iniziare con Global Standard

Per la maggior parte dei carichi di lavoro, iniziare con Global Standard. Viene avviato per la prima volta quando viene rilasciato un nuovo modello, ha il prezzo più basso e offre la copertura dell'area più ampia. Passare a un altro tipo di distribuzione solo quando si ha un motivo specifico, ad esempio la residenza dei dati, la velocità effettiva riservata o l'elaborazione batch asincrona.

I nuovi tipi di distribuzione diventano disponibili in un ordine impostato: Globale, quindi Zona dati, quindi singola area. I tipi di distribuzione a singola area arrivano per ultimo, non hanno una data di disponibilità garantita e dipendono dalla capacità che libera fino al ritiro dei modelli meno recenti. Per l'ordine di avvio autorevole, vedere Avvio e disponibilità del modello.

Confronto tra tipi di distribuzione

I modelli istantanei consentono di eseguire l'inferenza senza creare una distribuzione, quindi non sono tipi di distribuzione. Per provare immediatamente un modello, vedere Accesso immediato ai modelli.

Tipo di distribuzione Codice SKU Elaborazione dei dati Fatturazione Migliore per
Standard globale GlobalStandard Qualsiasi regione Azure Pagamento in base al token Carichi di lavoro generali, quota più elevata
Con provisioning globale GlobalProvisionedManaged Qualsiasi regione Azure PTU riservato Elevata larghezza di banda prevedibile
Batch globale GlobalBatch Qualsiasi regione Azure 50% sconto, 24 ore Attività asincrone di grandi dimensioni
Zona Dati Standard DataZoneStandard All'interno dell'area dati Pagamento in base al token Conformità dell'area dati UE/US/APAC
Area dati configurata DataZoneProvisionedManaged All'interno dell'area dati PTU riservato Zona dati e velocità effettiva prevedibile
Batch area dati DataZoneBatch All'interno dell'area dati 50% sconto Processi asincroni di grandi dimensioni con zona dati
Standard Standard Regione singola Pagamento in base al token Conformità regionale, volume basso
Provisionamento regionale ProvisionedManaged Regione singola PTU riservato Conformità regionale e capacità di trasmissione
Sviluppatore DeveloperTier Qualsiasi regione Azure Pagamento in base al token Solo valutazione del modello ottimizzata (durata di 24 ore, nessun contratto di servizio o garanzia di residenza dei dati)

Nota

Non tutti i modelli supportano tutti i tipi di distribuzione. Controlla i modelli Foundry venduti da Azure per verificare la disponibilità dei modelli in base al tipo di distribuzione e all'area geografica.

Le garanzie del contratto di servizio variano in base al tipo di distribuzione. I tipi di cui è stato effettuato il provisioning offrono una velocità effettiva garantita e una varianza di latenza inferiore. I tipi standard offrono un servizio al meglio delle possibilità. Le distribuzioni degli sviluppatori non includono un contratto di servizio. Per informazioni dettagliate, vedere il contratto di servizio Azure per Servizio Azure OpenAI.

Suggerimento

Per informazioni dettagliate sui prezzi, vedere Servizio Azure OpenAI prezzi.

Scegliere il tipo di distribuzione corretto

Usare la tabella seguente per una raccomandazione rapida, quindi perfezionarla con i criteri che seguono.

Requisito Livello consigliato
Impostazione predefinita: modelli più recenti, prezzo più basso, aree più ampie Standard globale
Velocità effettiva riservata e prevedibile Fornito globalmente
Mantenere l'elaborazione all'interno di una zona dati Provisioning dell'area dati o standard della zona dati
Residenza dei dati e velocità effettiva riservata Zona dati provisionata
Aggiungere l'elaborazione a una singola area Provisioning standard o a livello di area (se supportato)
Processi asincroni di grandi dimensioni a costi inferiori Batch globale o batch di zona dati (se supportato)
Valutare un modello ottimizzato (temporaneo, senza contratto di servizio) Developer

In base ai requisiti di residenza dei dati

  • Nessuna restrizione: Usare il Global Standard o il Global Provisioned
  • Area dati UE, Stati Uniti o APAC: usare la zona dati Standard o la zona dati di cui è stato effettuato il provisioning in un'area all'interno di tale zona dati
  • Solo singola area: usare il provisioning standard o a livello di area

Per le aree esatte in ogni zona dati, vedere Distribuzioni di zone dati.

In base al modello di carico di lavoro

  • Avvio rapido, creazione di prototipi o tentativo di un nuovo modello: usare l'accesso immediato (anteprima) ( nessuna distribuzione necessaria)
  • Variabile, traffico intermittente: usare Standard o Standard globale (con pagamento in base al token)
  • Volume coerente elevato: utilizzare tipi provisionati (capacità riservata)
  • Processi batch di grandi dimensioni (non sensibili al tempo): usare batch globale o batch di zona dati (50% risparmio sui costi)
  • Valutazione del modello ottimizzata: usare lo Sviluppatore (nessun contratto di servizio, costo più basso)

Per requisito di latenza

  • Richiesta bassa varianza di latenza: usare tipi provisionati
  • Varianza di latenza accettabile: usare i tipi Standard
  • Valutazione di un modello ottimizzato: usare lo sviluppatore (nessun contratto di servizio, non destinato a carichi di lavoro sensibili alla latenza).

Luoghi di elaborazione dati

Le distribuzioni standard e con provisioning offrono entrambe tre opzioni di elaborazione dati: globale, zona dati e singola area (area geografica Azure). Lo standard globale è un punto di partenza comune per la maggior parte dei carichi di lavoro.

Distribuzioni globali

Le distribuzioni globali usano l'infrastruttura globale di Azure per instradare dinamicamente il traffico ai data center disponibili. Le distribuzioni globali offrono i limiti di velocità effettiva iniziali più elevati e la disponibilità più ampia del modello.

Per i carichi di lavoro con volumi elevati, è possibile che si verifichi un aumento della latenza. Se è necessaria una varianza di latenza inferiore su larga scala, usare i tipi di distribuzione con provisioning.

Le distribuzioni globali ricevono innanzitutto i nuovi modelli e le funzionalità.

Implementazioni della Zona Dati

Per i tipi di distribuzione globale , il servizio può elaborare richieste e risposte in qualsiasi area geografica in cui viene distribuito il modello. Per i tipi di distribuzione zona dati , il servizio elabora richieste e risposte solo all'interno dell'area dati specificata:

  • Stati Uniti: il servizio elabora i dati ovunque negli Stati Uniti.
  • Unione europea: il servizio elabora i dati all'interno del Azure limite dei dati dell'UE.
  • Asia Pacifico: il servizio elabora i dati all'interno dell'area dati APAC.

L'area dati DELL'UE segue il Azure confine dei dati dell'UE, che può includere paesi e aree geografiche dell'Associazione europea per il libero scambio (EFTA), ad esempio Norvegia e Svizzera, oltre agli Stati membri dell'UE. La zona dati APAC copre più aree Asia Pacifico. Microsoft possibile aggiungere aree a una zona dati senza preavviso per migliorare la capacità e la disponibilità. Per la suddivisione corrente per area, vedere la sezione "Disponibilità dell'area del modello per tipo di distribuzione" di Foundry Models venduta da Azure.

Nota

Con i tipi di distribuzione Standard Globale e Standard Zona Dati, se la regione primaria subisce un'interruzione del servizio, tutto il traffico che era inizialmente indirizzato a questa regione è interessato. Per altre informazioni, vedere la guida alla disponibilità elevata e al ripristino di emergenza.

Standard globale

  • Nome SKU nel codice: GlobalStandard

Le distribuzioni Standard globali usano l'infrastruttura globale di Azure per instradare dinamicamente il traffico ai data center disponibili. Questo tipo di distribuzione fornisce la quota predefinita più elevata ed elimina la necessità di bilanciare il carico tra più risorse.

I clienti con un volume coerente elevato potrebbero riscontrare una maggiore variabilità di latenza. La soglia viene impostata per modello. Per ulteriori informazioni, vedere la pagina Quotas. Per le applicazioni che richiedono una variazione della latenza inferiore a un elevato utilizzo del carico di lavoro, prendere in considerazione il throughput predefinito.

Global Standard supporta l'elaborazione prioritaria per tempi di risposta più rapidi in base al consumo. Per altre informazioni, vedere Elaborazione prioritaria per i modelli Foundry.

Fornito globalmente

  • Nome SKU nel codice: GlobalProvisionedManaged

Le distribuzioni con provisioning globale usano l'infrastruttura globale di Azure per instradare dinamicamente il traffico ai data center disponibili. Questo tipo di distribuzione offre capacità riservata di elaborazione dei modelli per un throughput prevedibile, combinando il routing globale con la capacità garantita.

Con il throughput assegnato, si acquista un numero fisso di unità elaborate con provisioning (PTU) che garantiscono un livello specifico di capacità di elaborazione. Questo tipo di distribuzione offre una latenza più bassa e coerente rispetto a Global Standard. Per altre informazioni, vedere Concetti relativi alla velocità effettiva con provisioning.

Batch globale

  • Nome SKU nel codice: GlobalBatch

Global Batch gestisce attività di elaborazione su larga scala e con volumi elevati. È possibile elaborare gruppi asincroni di richieste con quota separata e un obiettivo di elaborazione di 24 ore, a costo inferiore del 50% rispetto a Global Standard. Con l'elaborazione batch, anziché inviare una richiesta alla volta, si invia un numero elevato di richieste in un singolo file. Le richieste di Batch globali hanno una quota di token accodata separata, che consente di evitare interruzioni dei carichi di lavoro online.

Casi d'uso comuni:

  • Elaborazione dei dati su larga scala: analizzare i set di dati in parallelo.
  • Generazione di contenuto: creare volumi elevati di testo, ad esempio descrizioni di prodotti o articoli.
  • Revisione e riepilogo dei documenti: elaborare e riepilogare documenti lunghi.
  • Automazione del supporto tecnico: gestire contemporaneamente numerose query.
  • Estrazione e analisi dei dati: estrarre e analizzare informazioni da grandi quantità di dati non strutturati.
  • Attività di elaborazione del linguaggio naturale (NLP): Eseguire analisi del sentiment o traduzione su set di dati di grandi dimensioni.

Nota

Le distribuzioni batch sacrificano la reattività in tempo reale per ottenere risparmi sui costi. Le richieste batch non hanno un contratto di servizio in tempo reale. Il completamento è previsto entro 24 ore, ma potrebbe richiedere più tempo.

Zona Dati Standard

  • Nome SKU nel codice: DataZoneStandard

Le distribuzioni standard della zona dati instradano dinamicamente il traffico ai data center all'interno della zona dati definita dall'Microsoft (Stati Uniti, UE o APAC). Questo tipo di distribuzione fornisce quote predefinite superiori rispetto ai tipi di distribuzione a singola area mantenendo i dati all'interno della zona specificata.

I clienti con un volume coerente elevato potrebbero riscontrare una maggiore variabilità di latenza. La soglia viene impostata per modello. Per altre informazioni, vedere la pagina quote e limiti. Per i carichi di lavoro che richiedono una bassa varianza di latenza in un volume elevato, prendere in considerazione i tipi di distribuzione preconfigurati.

Data Zone Standard supporta l'elaborazione prioritaria per tempi di risposta più rapidi con tariffazione a consumo. Per altre informazioni, vedere Elaborazione prioritaria per i modelli Foundry.

Zona dati provisionata

  • Nome SKU nel codice: DataZoneProvisionedManaged

Le distribuzioni Data Zone Provisioned instradano dinamicamente il traffico all'interno della zona dati specificata da Microsoft (Stati Uniti, UE o APAC) e al contempo forniscono capacità riservata per l'elaborazione del modello. Questo tipo di distribuzione combina la conformità della zona di dati con throughput elevato e prevedibile.

Batch area dati

  • Nome SKU nel codice: DataZoneBatch

Le distribuzioni batch di zona dati offrono le stesse funzionalità di Global Batch, tra cui 50% risparmio sui costi e turnaround di 24 ore. Il traffico viene instradato solo ai data center all'interno della zona dati definita dall'Microsoft (Stati Uniti, UE o APAC).

Standard

  • Nome SKU nel codice: Standard

Le distribuzioni standard usano la fatturazione con pagamento per token. Si paga solo per ciò che si consuma. I modelli disponibili in ciascuna regione e la capacità potrebbero essere limitati.

Le distribuzioni standard sono adatte per carichi di lavoro con volumi da bassi a medi e con picchi di attività elevati. I clienti con un volume coerente elevato potrebbero riscontrare una maggiore variabilità di latenza.

Provisioning a livello di area

  • Nome SKU nel codice: ProvisionedManaged

Le distribuzioni con provisioning a livello di area consentono di specificare la quantità di velocità effettiva necessaria in una distribuzione. Il servizio alloca quindi la capacità di elaborazione del modello necessaria e garantisce che sia pronta per l'utente. Il throughput è definito in termini di unità di throughput fornite (PTU), che è un modo standardizzato per rappresentare il throughput per la tua implementazione. Ogni coppia di versioni del modello richiede quantità diverse di PTU da distribuire e fornisce quantità diverse di velocità effettiva per PTU. I requisiti PTU minimi variano in base al modello. Per la capacità disponibile e i minimi correnti, vedere Concetti relativi al throughput assegnato.

Sviluppatore (per modelli ottimizzati)

  • Nome SKU nel codice: DeveloperTier

Il tipo di distribuzione Developer è progettato solo per la valutazione del modello affinata. Fornisce test convenienti dei modelli personalizzati, ma non include garanzie di residenza dei dati o un contratto di servizio. Le distribuzioni degli sviluppatori hanno una durata fissa di 24 ore e vengono eliminate automaticamente dopo la scadenza. Per altre informazioni sull'uso del tipo di distribuzione Developer, vedere la guida all'ottimizzazione.

Risoluzione dei problemi di distribuzione

Problemi comuni durante la creazione o l'uso delle distribuzioni:

Problema Causa Risoluzione
Tipo di distribuzione non disponibile Il modello non supporta il tipo selezionato Controllare la disponibilità del modello in base al tipo di distribuzione
Quota superata Limite di sottoscrizione raggiunto per i token al minuto Richiedere l'aumento della quota nel portale di Azure o usare un'area diversa
Area non disponibile Modello non distribuito nell'area selezionata Selezionare un'area dall'elenco di disponibilità del modello
Capacità provisionata non disponibile Nessuna capacità PTU nell'area Provare un'area diversa o usare Provisioning globale per una disponibilità più ampia

Per i limiti di quota per tipo di distribuzione, vedere Quote e limiti dei modelli Foundry.

Limitare i tipi di distribuzione con Criteri di Azure

Criteri di Azure consente di applicare gli standard dell'organizzazione e di valutare la conformità su larga scala. Tramite il dashboard di conformità, è possibile valutare lo stato complessivo dell'ambiente ed eseguire il drill-down in base alla granularità per risorsa e ai criteri. Criteri di Azure supporta anche la correzione in blocco per le risorse esistenti e la correzione automatica per le nuove risorse. Altre informazioni su Criteri di Azure e controlli predefiniti specifici per gli strumenti Foundry.

Usare i seguenti criteri per disabilitare l'accesso a un specifico tipo di distribuzione Foundry. Sostituire GlobalStandard con il nome dello SKU per il tipo di distribuzione che si vuole limitare.

{
    "mode": "All",
    "policyRule": {
        "if": {
            "allOf": [
                {
                    "field": "type",
                    "equals": "Microsoft.CognitiveServices/accounts/deployments"
                },
                {
                    "field": "Microsoft.CognitiveServices/accounts/deployments/sku.name",
                    "equals": "GlobalStandard"
                }
            ]
        }
    }
}