Formation distribuée à l'aide de DeepSpeed
Bêta
Cette fonctionnalité est en Bêta. Les administrateurs du Workspace peuvent contrôler l'accès à cette fonctionnalité à partir de la page Previews . Consultez Gérer les aperçus Databricks.
Cette page contient des exemples de Notebook pour l'entraînement distribué à l'aide de DeepSpeed sur AI Runtime. DeepSpeed fournit des techniques avancées d'optimisation de la mémoire grâce à ses étapes ZeRO (Zero Redundancy Optimizer), permettant l'entraînement efficace de grands modèles.
Quand utiliser DeepSpeed
Utilisez DeepSpeed lorsque :
- Vous avez besoin d'une optimisation avancée de la mémoire au-delà du FSDP standard
- Vous souhaitez un contrôle précis sur le sharding de l'état de l'optimiseur (ZeRO Stage 1, 2 ou 3)
- Vous avez besoin de fonctionnalités supplémentaires comme la fusion par accumulation de gradient ou le déchargement de CPU.
- Vous travaillez avec de grands modèles de langage (1 milliard à plus de 100 milliards de parameters)
Pour les cas d'utilisation plus simples, envisagez DDP. Pour l'entraînement de grands modèles natifs de PyTorch, consultez FSDP.
Exemples
Didacticiel | Description |
|---|---|
Affinement supervisé à l'aide de TRL et DeepSpeed ZeRO Stage 3 | Utilisez l'API Python GPU Serverless pour exécuter l'affinement supervisé (SFT) à l'aide de la bibliothèque Transformer Reinforcement Learning (TRL) avec l'optimisation DeepSpeed ZeRO Stage 3 sur un GPU A10 à nœud unique. |