Aller au contenu principal

Formation distribuée de données parallèles (DDP)

info

Bêta

Cette fonctionnalité est en Bêta. Les administrateurs du Workspace peuvent contrôler l'accès à cette fonctionnalité à partir de la page Previews . Consultez Gérer les aperçus Databricks.

Cette page contient des exemples de notebooks pour l'utilisation de l'entraînement Distributed Data Parallel (DDP) sur AI Runtime. Le DDP est la technique de parallélisme la plus courante pour l'entraînement distribué, où le modèle complet est répliqué sur chaque GPU et les batchs de données sont répartis entre les GPU.

Quand utiliser DDP

Utilisez DDP lorsque :

  • Votre modèle tient entièrement dans la mémoire d'un seul GPU
  • Vous voulez monter en charge l'entraînement en augmentant le throughput des données
  • Vous avez besoin de l'approche de formation distribuée la plus simple avec prise en charge automatique dans la plupart des frameworks.

Pour les modèles plus volumineux qui ne tiennent pas dans la mémoire d'un seul GPU, envisagez plutôt FSDP ou DeepSpeed.

Exemples

Didacticiel

Description

Entraînement d'un simple réseau de neurones à perceptron multicouche (MLP) à l'aide de PyTorch DDP

Ce Notebook présente l'entraînement distribué d'un simple réseau de neurones perceptron multicouche (MLP) à l'aide du module DDP de PyTorch sur Databricks avec des ressources GPU serverless.

Entraînement du modèle OpenAI GPT-OSS 20B sur 8 H100 à l'aide de TRL et DDP

Ce Notebook démontre comment utiliser l'API Python Serverless GPU pour exécuter l'affinement supervisé (SFT) sur le modèle GPT-OSS 20B de Hugging Face à l'aide de la bibliothèque Transformer Reinforcement Learning (TRL). Cet exemple utilise DDP sur l'ensemble des 8 GPU H100 du nœud pour monter en charge la taille de batch global.

Affinement distribué de Llama 3.2 3B avec Unsloth

Ce Notebook démontre comment utiliser l' API Python Serverless pour GPU afin d'affiner un modèle Llama 3.2 3B avec la bibliothèque Unsloth sur 8 GPU A10. Unsloth offre des optimisations d'entraînement à mémoire efficace et utilise DDP en interne via Hugging Face Accelerate.

Affinement distribué d'Olmo3 7B à l'aide d'Axolotl

Ce Notebook démontre comment utiliser l’ API Python Serverless GPU pour affiner un modèle Olmo3 7B avec la bibliothèque Axolotl sur 16 GPU H100. Axolotl est conçu pour simplifier le post-entraînement et l'affinement des derniers LLM.

Entraînement d’un système de recommandation à deux tours à l’aide de PyTorch Lightning

Ce notebook démontre comment entraîner un modèle de recommandation à deux tours à l'aide de PyTorch Lightning sur GPU serverless. PyTorch Lightning fournit une interface de haut niveau qui gère automatiquement la configuration DDP pour l’entraînement multi-GPU. L'exemple inclut la préparation des données au format Mosaic Streaming (MDS) et l'entraînement distribué sur les GPU A10 ou H100.

Consultez la page Exemples de recommandations de deep learning pour les notebooks complets, notamment :

  • Préparation des données et conversion du format MDS
  • Formation de recommandation à deux tours avec PyTorch Lightning

Didacticiel

Description

Entraînement d'un simple réseau de neurones à perceptron multicouche (MLP) à l'aide de PyTorch DDP

Ce Notebook présente l'entraînement distribué d'un simple réseau de neurones perceptron multicouche (MLP) à l'aide du module DDP de PyTorch sur Databricks avec des ressources GPU serverless.

Entraînement du modèle OpenAI GPT-OSS 20B sur 8 H100 à l'aide de TRL et DDP

Ce Notebook démontre comment utiliser l'API Python Serverless GPU pour exécuter l'affinement supervisé (SFT) sur le modèle GPT-OSS 20B de Hugging Face à l'aide de la bibliothèque Transformer Reinforcement Learning (TRL). Cet exemple utilise DDP sur l'ensemble des 8 GPU H100 du nœud pour monter en charge la taille de batch global.

Affinement distribué de Llama 3.2 3B avec Unsloth

Ce Notebook démontre comment utiliser l' API Python Serverless pour GPU afin d'affiner un modèle Llama 3.2 3B avec la bibliothèque Unsloth sur 8 GPU A10. Unsloth offre des optimisations d'entraînement à mémoire efficace et utilise DDP en interne via Hugging Face Accelerate.

Affinement distribué d'Olmo3 7B à l'aide d'Axolotl

Ce Notebook démontre comment utiliser l’ API Python Serverless GPU pour affiner un modèle Olmo3 7B avec la bibliothèque Axolotl sur 16 GPU H100. Axolotl est conçu pour simplifier le post-entraînement et l'affinement des derniers LLM.

Entraînement d’un système de recommandation à deux tours à l’aide de PyTorch Lightning

Ce notebook démontre comment entraîner un modèle de recommandation à deux tours à l'aide de PyTorch Lightning sur GPU serverless. PyTorch Lightning fournit une interface de haut niveau qui gère automatiquement la configuration DDP pour l’entraînement multi-GPU. L'exemple inclut la préparation des données au format Mosaic Streaming (MDS) et l'entraînement distribué sur les GPU A10 ou H100.

Consultez la page Exemples de recommandations de deep learning pour les notebooks complets, notamment :

  • Préparation des données et conversion du format MDS
  • Formation de recommandation à deux tours avec PyTorch Lightning

Entraînement d'un simple perceptron multicouche (MLP) réseau de neurones using PyTorch DDP

Le notebook suivant présente la formation distribuée d'un réseau de neurones à perceptron multicouche (MLP) simple, à l'aide du module DDP de PyTorch sur Databricks avec des ressources GPU Serverless.

PyTorch DDP

Entraînement d'un système de recommandation à deux tours utilisant PyTorch Lightning

Ce notebook montre comment entraîner un modèle de recommandation à deux tours avec PyTorch Lightning sur AI Runtime. PyTorch Lightning fournit une interface de haut niveau qui gère automatiquement la configuration DDP pour l’entraînement multi-GPU. L'exemple inclut la préparation des données au format Mosaic Streaming (MDS) et l'entraînement distribué sur les GPU A10 ou H100.

Consultez la page Exemples de recommandations de deep learning pour les notebooks complets, notamment :

  • Préparation des données et conversion du format MDS
  • Formation de recommandation à deux tours avec PyTorch Lightning