Formation distribuée de données parallèles (DDP)
Bêta
Cette fonctionnalité est en Bêta. Les administrateurs du Workspace peuvent contrôler l'accès à cette fonctionnalité à partir de la page Previews . Consultez Gérer les aperçus Databricks.
Cette page contient des exemples de notebooks pour l'utilisation de l'entraînement Distributed Data Parallel (DDP) sur AI Runtime. Le DDP est la technique de parallélisme la plus courante pour l'entraînement distribué, où le modèle complet est répliqué sur chaque GPU et les batchs de données sont répartis entre les GPU.
Quand utiliser DDP
Utilisez DDP lorsque :
- Votre modèle tient entièrement dans la mémoire d'un seul GPU
- Vous voulez monter en charge l'entraînement en augmentant le throughput des données
- Vous avez besoin de l'approche de formation distribuée la plus simple avec prise en charge automatique dans la plupart des frameworks.
Pour les modèles plus volumineux qui ne tiennent pas dans la mémoire d'un seul GPU, envisagez plutôt FSDP ou DeepSpeed.
Exemples
Didacticiel | Description |
|---|---|
Entraînement d'un simple réseau de neurones à perceptron multicouche (MLP) à l'aide de PyTorch DDP | Ce Notebook présente l'entraînement distribué d'un simple réseau de neurones perceptron multicouche (MLP) à l'aide du module DDP de PyTorch sur Databricks avec des ressources GPU serverless. |
Entraînement du modèle OpenAI GPT-OSS 20B sur 8 H100 à l'aide de TRL et DDP | Ce Notebook démontre comment utiliser l'API Python Serverless GPU pour exécuter l'affinement supervisé (SFT) sur le modèle GPT-OSS 20B de Hugging Face à l'aide de la bibliothèque Transformer Reinforcement Learning (TRL). Cet exemple utilise DDP sur l'ensemble des 8 GPU H100 du nœud pour monter en charge la taille de batch global. |
Ce Notebook démontre comment utiliser l' API Python Serverless pour GPU afin d'affiner un modèle Llama 3.2 3B avec la bibliothèque Unsloth sur 8 GPU A10. Unsloth offre des optimisations d'entraînement à mémoire efficace et utilise DDP en interne via Hugging Face Accelerate. | |
Ce Notebook démontre comment utiliser l’ API Python Serverless GPU pour affiner un modèle Olmo3 7B avec la bibliothèque Axolotl sur 16 GPU H100. Axolotl est conçu pour simplifier le post-entraînement et l'affinement des derniers LLM. | |
Entraînement d’un système de recommandation à deux tours à l’aide de PyTorch Lightning | Ce notebook démontre comment entraîner un modèle de recommandation à deux tours à l'aide de PyTorch Lightning sur GPU serverless. PyTorch Lightning fournit une interface de haut niveau qui gère automatiquement la configuration DDP pour l’entraînement multi-GPU. L'exemple inclut la préparation des données au format Mosaic Streaming (MDS) et l'entraînement distribué sur les GPU A10 ou H100. Consultez la page Exemples de recommandations de deep learning pour les notebooks complets, notamment :
|
Entraînement d'un simple perceptron multicouche (MLP) réseau de neurones using PyTorch DDP
Le notebook suivant présente la formation distribuée d'un réseau de neurones à perceptron multicouche (MLP) simple, à l'aide du module DDP de PyTorch sur Databricks avec des ressources GPU Serverless.
PyTorch DDP
Entraînement d'un système de recommandation à deux tours utilisant PyTorch Lightning
Ce notebook montre comment entraîner un modèle de recommandation à deux tours avec PyTorch Lightning sur AI Runtime. PyTorch Lightning fournit une interface de haut niveau qui gère automatiquement la configuration DDP pour l’entraînement multi-GPU. L'exemple inclut la préparation des données au format Mosaic Streaming (MDS) et l'entraînement distribué sur les GPU A10 ou H100.
Consultez la page Exemples de recommandations de deep learning pour les notebooks complets, notamment :
- Préparation des données et conversion du format MDS
- Formation de recommandation à deux tours avec PyTorch Lightning