Nota:
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
Importante
Esta característica se encuentra en su versión beta. Los administradores del área de trabajo pueden controlar el acceso a esta característica desde la página Vistas previas . Consulte Administrar versiones preliminares de Azure Databricks.
En esta página se incluyen ejemplos de cuadernos para el entrenamiento distribuido mediante DeepSpeed en tiempo de ejecución de IA. DeepSpeed proporciona técnicas avanzadas de optimización de memoria a través de sus fases zeRO (optimizador de redundancia cero), lo que permite un entrenamiento eficaz de modelos grandes.
Cuándo usar DeepSpeed
Use DeepSpeed cuando:
- Necesita optimización avanzada de memoria más allá del FSDP estándar.
- Desea un control específico sobre el particionamiento de estado del optimizador (ZeRO Stage 1, 2 o 3)
- Necesita funciones adicionales, como la fusión de acumulación de gradientes o la descarga de CPU.
- Estás trabajando con modelos de lenguaje grandes (1B a 100B+ parámetros)
Para casos de uso más sencillos, considere DDP. Para el entrenamiento nativo de PyTorch de modelos grandes, consulte FSDP.
Ejemplos
| Tutorial | Descripción |
|---|---|
| Ajuste fino supervisado mediante TRL y DeepSpeed ZeRO Stage 3 | Utiliza la API de Python para GPU sin servidor para ejecutar un ajuste fino supervisado (SFT) usando la biblioteca Transformer Reinforcement Learning (TRL) con optimización DeepSpeed ZeRO Stage 3 en una sola GPU A10. |