Entrenamiento distribuido con varias GPU

Importante

Esta característica se encuentra en su versión beta. Los administradores del área de trabajo pueden controlar el acceso a esta característica desde la página Vistas previas . Consulte Administrar versiones preliminares de Azure Databricks.

Estos notebooks permiten escalar el entrenamiento de modelos entre varias GPU y nodos en AI Runtime. Cubren las tres técnicas principales de paralelismo, DDP, FSDP y DeepSpeed ZeRO, mediante la API de serverless_gpu Python en GPU H100.

Nota:

El entrenamiento distribuido con varias GPU se admite en GPU H100.

Elección de la técnica de paralelismo

Al escalar el entrenamiento del modelo en varias GPU, elegir la técnica de paralelismo adecuada depende del tamaño del modelo, la memoria de GPU disponible y los requisitos de rendimiento.

Técnica Cuándo se deben usar
DDP (datos distribuidos paralelos) El modelo completo se ajusta a una sola memoria de GPU; necesidad de escalar el rendimiento de los datos
FSDP (datos totalmente particionados paralelos) Modelos muy grandes que no caben en una sola memoria de GPU
DeepSpeed ZeRO Modelos grandes con necesidades avanzadas de optimización de memoria

Para obtener información detallada sobre cada técnica, consulte DDP, FSDP y DeepSpeed.

Cuadernos de ejemplo según técnica y entorno de trabajo

En la tabla siguiente se organizan los notebooks de muestra según el marco o biblioteca que esté utilizando y la técnica de paralelismo aplicada. Varios cuadernos pueden aparecer en una sola celda.

Marco de trabajo/Biblioteca Ejemplos de DDP Ejemplos de FSDP Ejemplos de DeepSpeed
PyTorch (nativo) Red neuronal de MLP simple
Detección de imágenes de RetinaNet
Transformador de parámetros 10M
Huggingface TRL Ajuste de gpt OSS 20B Ajuste de gpt OSS 120B Ajuste de Llama 3.2 1B
Unsloth Ajuste de Llama 3.2 3B
Axolotl Ajuste de Olmo3 7B
Mosaico LLM Fundición Ajuste de Llama 3.2 8B
Relámpago Sistema de recomendación de dos torres

Empieza ahora

Use los siguientes tutoriales para empezar a trabajar con la biblioteca python de GPU sin servidor para el entrenamiento distribuido:

Tutorial Descripción
Entorno de ejecución de IA con GPU H100 Aprenda a usar Databricks AI Runtime con aceleradores H100 para ejecutar cargas de trabajo distribuidas de GPU mediante la biblioteca de Python de serverless_gpu.