Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
AI Runtime é uma solução de computação da Databricks destinada a cargas de trabalho de aprendizagem profunda e oferece suporte para GPU no Databricks Serverless. Pode usar o AI Runtime para treinar e afinar modelos personalizados usando os seus frameworks favoritos e obter eficiência, desempenho e qualidade de última geração. Para uma visão geral de como a computação serverless se integra na arquitetura Databricks, veja Arquitetura de workspace serverless.
Principais características
- Infraestrutura de GPU totalmente gerida: Serverless, acesso flexível às GPUs e sem configuração de cluster, seleção de drivers ou políticas de autoscaling para gerir.
- Um tempo de execução dedicado à aprendizagem profunda: Escolha um ambiente Standard mínimo para máxima flexibilidade em relação às dependências ou um ambiente de IA completo pré-equipado com frameworks populares de ML.
- Integrado nativamente entre notebooks, jobs, Unity Catalog e MLflow para desenvolvimento fluido, acesso a dados e rastreio de experiências.
- Suporte de conformidade: Apoia a maioria das normas de conformidade. Para as normas suportadas e exceções, consulte o perfil de segurança de conformidade.
Opções de hardware
Todos os aceleradores de tempo de execução de IA fornecem um único nó. O número de GPUs nesse nó depende do tipo de acelerador:
| Acelerador | GPUs por nó | Memória GPU | Melhor para | Preparação distribuída |
|---|---|---|---|---|
| 1xA10 | 1 | 24 GB | Tarefas pequenas a médias de ML e aprendizagem profunda, como modelos clássicos de ML ou ajuste fino de modelos de linguagem mais pequenos | Não suportado (GPU única) |
| 1xH100 | 1 | 80 GB | Cargas de trabalho que necessitam de mais memória de GPU do que a fornecida por 1xA10, mas que não requerem treino distribuído em várias GPUs, como o ajuste fino de modelos de linguagem de tamanho médio | Não suportado (GPU única) |
| 8xH100 | 8 | 80 GB por GPU | Cargas de trabalho em IA em grande escala, incluindo treino ou ajuste fino de modelos massivos ou execução de tarefas avançadas de aprendizagem profunda | Suportado através do uso do decorador @distributed com gpus=8 |
Casos de uso recomendados
A Databricks recomenda AI Runtime para quaisquer casos de uso de treino de modelos personalizados que envolvam deep learning, cargas de trabalho clássicas de grande escala ou GPUs.
Por exemplo:
- Ajuste fino de LLM (LoRA, QLoRA, ajuste fino completo)
- Visão computacional (deteção de objetos, classificação de imagem)
- Sistemas de recomendação baseados em aprendizagem profunda
- Aprendizagem por reforço
- Previsão de séries cronológicas baseada em aprendizagem profunda
Requisitos
- Um espaço de trabalho numa das seguintes regiões suportadas pelo Azure:
centraluseastuseastus2northcentraluswestcentraluswestuswestus3
Limitações
- O AI Runtime só suporta aceleradores A10 e H100.
- O AI Runtime não suporta o perfil de segurança de conformidade para as normas FedRAMP High ou DoD IL5. Todas as outras normas de conformidade são suportadas.
- Adicionar dependências usando o Environments não é suportado para trabalhos agendados no AI Runtime. Instala as dependências programaticamente usando
%pip installno teu notebook em vez disso. - Para trabalhos agendados no AI Runtime, o comportamento de recuperação automática para versões de pacotes incompatíveis associadas ao seu portátil não é suportado.
- O tempo de execução máximo para uma carga de trabalho é de sete dias. Para trabalhos de treino de modelos que excedam este limite, implemente checkpointing e reinicie o trabalho assim que o tempo máximo de execução for atingido.
- O AI Runtime fornece acesso sob demanda aos recursos da GPU. Embora isto conduza a um acesso fácil e flexível às GPUs, pode haver períodos em que a capacidade é limitada ou indisponível na sua região.
- O AI Runtime aproveita GPUs multi-região em certos casos durante momentos de alta procura. Podem existir custos de saída associados a tal utilização, e a conectividade de rede entre regiões pode ser limitada em determinados momentos.
Conectar ao Ambiente de Execução de IA
Pode ligar-se ao AI Runtime interativamente a partir de notebooks, um terminal IDE usando um túnel SSH, trabalhos agendados, a API Jobs e Declarative Automation Bundles. Para instruções passo a passo, consulte Conectar ao Runtime de IA.
Configurar ambiente
O AI Runtime oferece dois ambientes Python geridos: um ambiente Standard mínimo e um ambiente de IA Databricks completo, pré-carregado com frameworks populares de ML como PyTorch e Transformers. Para detalhes sobre a escolha de um ambiente, comportamento de cache, importação de módulos personalizados e limitações conhecidas, veja Configurar o seu ambiente.
Carregar dados no ambiente de execução da IA
Compreender como funciona o acesso a dados no AI Runtime é essencial para uma experiência fluida. Para detalhes, consulte Carregar dados no Runtime de IA.
Formação distribuída
O AI Runtime suporta treino distribuído entre múltiplas GPUs no único nó a que o seu portátil está ligado. Utilizando o decorador @distributed da API Python serverless_gpu, pode executar cargas de trabalho com várias GPUs com PyTorch DDP, FSDP ou DeepSpeed com uma configuração mínima. Para mais detalhes, consulte Formação distribuída em cadernos.
Acompanhamento e observabilidade de experimentos
Para integração de MLflow, visualização de registos de sistema e gestão de ponto de verificação de modelos, consulte Acompanhamento e observabilidade de experiências.
Código Genie para aprendizagem profunda
O Genie Code suporta cargas de trabalho de aprendizagem profunda em tempo de execução de IA. Pode ajudar a gerar código de treino, resolver erros de instalação de bibliotecas, sugerir otimizações e depurar problemas comuns. Consulte Use Genie Code para ciência de dados.
Guides
Para migração de cargas de trabalho clássicas, notebooks de exemplo e resolução de problemas, consulte os guias de utilizador para IA Runtime.