Panoramica della distribuzione per i modelli di Microsoft Foundry

Microsoft Foundry Models è l'hub per l'individuazione e la distribuzione di un'ampia gamma di modelli di intelligenza artificiale per le applicazioni di intelligenza artificiale generative. Per rendere disponibile un modello per le richieste di inferenza, lo distribuisci. Foundry offre due opzioni di distribuzione a seconda del tipo di modello e delle esigenze dell'infrastruttura.

Suggerimento

Non è sempre necessario creare una distribuzione. Con l'accesso immediato (anteprima) è possibile chiamare i modelli supportati in base al nome e avviare immediatamente l'esecuzione dell'inferenza, senza che sia necessaria alcuna distribuzione.

Opzioni di distribuzione

Foundry offre due opzioni di distribuzione:

  • API serverless : per i modelli foundry, inclusi i modelli Foundry venduti da Azure e selezionare Modelli da partner e community. Questa opzione è il percorso di distribuzione preferito e più idoneo. Include i tipi di distribuzione standard, con provisioning, batch e per sviluppatori.
  • Calcolo gestito (anteprima) — Per modelli open source, dei partner e personalizzati eseguiti su una capacità GPU dedicata che Foundry gestisce per te.

Foundry seleziona l'opzione di distribuzione appropriata in base al modello scelto.

Se è sufficiente provare un modello supportato, è possibile ignorare completamente la distribuzione e usare l'accesso immediato (anteprima), che chiama i modelli in base al nome senza creare un'API serverless o una distribuzione di calcolo gestita.

Diagramma che mostra la scelta tra l'accesso immediato, i tipi di distribuzione api serverless per ordine di avvio e il calcolo gestito.

Per un confronto completo delle funzionalità, vedere Confronto delle opzioni di distribuzione.

Serverless API

L'API serverless è l'opzione di distribuzione preferita in Foundry. Supporta la gamma più ampia di funzionalità e tipi di distribuzione.

Quali modelli utilizzano distribuzioni serverless di API?

Tutti i modelli Foundry, inclusi i modelli Foundry venduti da Azure e selezionano Modelli da partner e community, usano distribuzioni di API serverless. I Foundry Models venduti da Azure includono tutti i modelli Azure OpenAI e modelli selezionati dei principali provider, fatturati tramite l'abbonamento Azure, coperti dagli accordi sul livello di servizio di Azure e supportati da Microsoft. I modelli di partner e community che usano distribuzioni di API serverless includono Anthropic modelli e modelli specifici di partner come Mistral, Cohere e Meta.

Funzionalità dell'API serverless

Supporto delle distribuzioni di API serverless:

  • Più tipologie di distribuzione (o SKU di distribuzione) — Standard globale, Standard dell'area dati, Standard (singola regione), con provisioning, batch e altro ancora. Ogni tipo controlla dove vengono elaborati i dati e il modo in cui si paga. Per informazioni dettagliate, vedere Tipi di distribuzione per i modelli di Microsoft Foundry.
  • Flessibilità per l'elaborazione dei dati : scegliere area geografica, zona dati (Stati Uniti, UE o APAC) o elaborazione globale in base ai requisiti di conformità.
  • Filtro del contenuto : filtri predefiniti di Sicurezza dei contenuti di Azure per intelligenza artificiale con configurazioni personalizzabili.
  • Autenticazione senza chiave : MICROSOFT Entra ID (scelta consigliata) e autenticazione basata su chiave.
  • Rete privata : integrazione della rete virtuale per l'accesso sicuro.
  • Velocità effettiva con provisioning : riservare capacità con unità elaborate con provisioning (PTU) per prestazioni prevedibili e a bassa latenza. Per informazioni dettagliate, vedere Throughput predefinito.

Requisiti delle risorse

Le distribuzioni di API serverless sono disponibili in:

  • Risorse Foundry — Il tipo di risorsa principale per i nuovi progetti Foundry. Nessun hub di intelligenza artificiale richiesto.
  • Risorse OpenAI di Azure : se si usano risorse OpenAI di Azure, il catalogo dei modelli mostra solo i modelli OpenAI di Azure per la distribuzione. Aggiornare una risorsa Foundry per accedere al set completo di Modelli di Foundry.

Per iniziare con la distribuzione serverless di API, vedi Distribuire i modelli Microsoft Foundry nel portale Foundry o Distribuire i modelli usando interfaccia della riga di comando di Azure e Bicep.

Distribuzione di calcolo gestita (anteprima)

Note

Il calcolo gestito in Foundry è attualmente disponibile in anteprima pubblica. Questa anteprima viene fornita senza un contratto di servizio e non è consigliabile per i carichi di lavoro di produzione. Alcune funzionalità potrebbero non essere supportate o potrebbero avere funzionalità limitate. Per ulteriori informazioni, vedere Condizioni supplementari per l'uso delle versioni di anteprima di Microsoft Azure.

Il calcolo gestito in Foundry (anteprima) è una piattaforma GPU gestita come servizio (PaaS) che ospita modelli open source e con pesi personalizzati su capacità GPU dedicata. Puoi accedere alle distribuzioni di calcolo gestite tramite lo stesso endpoint del progetto Foundry usato per gli altri tipi di distribuzione, senza dover gestire macchine virtuali, cluster o runtime di serving. Foundry dimensiona il deployment, effettua il provisioning degli acceleratori e mantiene il runtime aggiornato con le patch.

Importante

Il calcolo gestito supporta modelli open source, partner, industry e personalizzati. Le distribuzioni di calcolo gestite vengono gestite nell'endpoint del progetto Foundry unificato, usando la stessa superficie di autenticazione, rete e SDK.

Quali modelli usano il calcolo gestito?

È possibile distribuire modelli della raccolta Hugging Face utilizzando risorse di calcolo gestite. Ecco alcuni esempi:

  • Modelli Qwen
  • Modelli NVIDIA Nemotron
  • Metamodelti selezionati
  • Modelli misti selezionati

Il catalogo di Microsoft Foundry include un'ampia e crescente selezione di modelli open source e dei partner. Per il catalogo corrente, vedere il catalogo dei modelli.

Funzionalità di calcolo gestite

Il calcolo gestito (anteprima) supporta:

  • Endpoint e autenticazione di Unified Foundry — Utilizza lo stesso endpoint di progetto, le stesse chiavi API, Microsoft Entra ID e la stessa rete privata delle distribuzioni pay-per-token e a larghezza di banda predefinita. I percorsi di inferenza usano <endpoint>/managed-deployments/<deployment-name>/. I runtime compatibili con il completamento automatico delle chat funzionano anche sulla rotta standard /openai/v1/ con l'SDK di OpenAI.
  • Dimensionamento delle istanze di modello : le distribuzioni vengono ridimensionate in termini incentrati sul modello. Non è necessario selezionare gli SKU delle macchine virtuali, perché Foundry sceglie GPU per istanza in base alle dimensioni del modello, all'architettura, alla lunghezza del contesto e al fatto che il carico di lavoro sia ottimizzato per latenza o velocità effettiva.
  • Runtime di inferenza ottimizzati — contenitori vLLM, SGLang e NVIDIA NIM selezionati da Microsoft con batching continuo e parallelismo tensoriale.
  • Famiglie di acceleratori : A100 (80 GB), H100 (80 GB) e MI300X (192 GB).
  • Ridimensionamento automatico e ridimensionamento a zero — Esegui il ridimensionamento automatico in base al traffico in tempo reale oppure manualmente. Configurare un timeout di inattività in modo che la distribuzione venga ridimensionata a zero quando non arriva alcun traffico, interrompendo immediatamente la fatturazione.
  • Runtime gestiti da Microsoft — Microsoft gestisce i runtime distribuiti, le immagini di base del contenitore e le patch di sicurezza. Gli aggiornamenti vengono applicati automaticamente alle distribuzioni in tempo reale.
  • Metriche di osservabilità : ogni distribuzione genera il conteggio delle chiamate API in base al codice di stato e ai percentili del tempo di risposta. I modelli di completamento chat restituiscono anche i conteggi dei token di input e output, i percentili del tempo al primo token (TTFT) e i percentili del tempo di risposta complessivo, raggruppati per intervallo di tempo.

Fatturazione e quota

La fatturazione dell'elaborazione gestita è oraria per SKU dell'acceleratore, con il throughput per GPU come unità di fatturazione di base. La scalabilità automatica e la riduzione a zero allineano i costi al traffico effettivo, in modo che la fatturazione si interrompa immediatamente quando le istanze vengono ridotte.

La quota viene concessa per ogni SKU dell'acceleratore per area geografica tramite il processo di quota Foundry ed è separata dalla quota delle macchine virtuali di Azure. Le macchine virtuali di Azure sono un'offerta di infrastruttura distribuita come servizio (IaaS) con SKU regionali; l'elaborazione gestita è un'offerta PaaS che si basa principalmente sull'elaborazione globale e Data Zone. La quota di macchine virtuali Azure esistente non può essere applicata a una distribuzione di calcolo gestita.

Il calcolo gestito è attualmente disponibile per la distribuzione globale. Per le stime dei tassi, vedere Azure calcolatore prezzi.

Inizia

Per iniziare a usare la distribuzione di calcolo gestita, vedere Distribuire modelli open source con calcolo gestito.

Confronto tra opzioni di distribuzione

Usare l'API serverless quando possibile. La tabella seguente confronta le funzionalità tra le due opzioni di distribuzione:

Note

L'accesso immediato (anteprima) non è un'opzione di distribuzione in questo confronto. Chiama i modelli supportati per nome senza creare un'API serverless o una distribuzione di calcolo gestita.

Capacità Serverless API Calcolo gestito
Quali modelli possono essere distribuiti? Tutti i modelli Foundry, compresi i modelli Foundry venduti da Azure e modelli selezionati di partner e della community Modelli open source e dei partner presenti nel catalogo dei modelli, NVIDIA NIM e modelli di settore
Risorsa di distribuzione Risorsa Foundry Progetto Fonderia
Richiede l'hub di intelligenza artificiale No No
Opzioni di elaborazione dati Area, zona dati, globale Generale
Rete privata
Filtro del contenuto Integrato e personalizzabile Non disponibile in anteprima pubblica
Autenticazione senza chiave Sì (Microsoft Entra ID e basato su chiave) Sì (Microsoft Entra ID e basato su chiave)
Fatturazione Utilizzo token o unità elaborate assegnate Prezzo orario per codice articolo dell'acceleratore

Suggerimento

Per informazioni dettagliate sui costi, vedi Pianificare e gestire i costi per Microsoft Foundry.