Aller au contenu principal

Formation entièrement en parallèle de données fragmentées (FSDP)

info

Bêta

Cette fonctionnalité est en Bêta. Les administrateurs du Workspace peuvent contrôler l'accès à cette fonctionnalité à partir de la page Previews . Consultez Gérer les aperçus Databricks.

Cette page propose des exemples de Notebooks pour l'utilisation de l'entraînement Fully Sharded Data Parallel (FSDP) sur AI Runtime. FSDP partitionne les paramètres du modèle, les gradients et les états de l'optimiseur entre les GPU, permettant l'entraînement de très grands modèles qui ne tiennent pas dans la mémoire d'un seul GPU.

Quand utiliser FSDP

Utilisez FSDP quand :

  • Votre modèle est trop grand pour tenir dans la mémoire d'un seul GPU
  • Vous devez entraîner des modèles dans la plage de paramètres de 20B à 120B+.
  • Vous voulez une meilleure efficacité de la mémoire que ne le permet DDP

Pour les modèles plus petits qui tiennent dans la mémoire d'un seul GPU, veuillez considérer DDP pour plus de simplicité. Pour les fonctionnalités avancées d'optimisation de la mémoire, consultez DeepSpeed.

Exemples

Didacticiel

Description

Entraînement d'un modèle Transformer avec 10 millions de paramètres à l'aide de FSDP2

Ce Notebook illustre la formation distribuée d'un modèle Transformer de 10 millions de paramètres utilisant la bibliothèque FSDP2.

Entraînement du modèle OpenAI GPT-OSS 120B à l'aide de TRL et FSDP

Ce Notebook démontre comment exécuter l'affinement supervisé (SFT) sur un modèle GPT-OSS 120B en utilisant FSDP2 et la bibliothèque Transformer Reinforcement Learning (TRL). Cet exemple exploite FSDP pour réduire la consommation de mémoire et DDP pour monter en charge la taille globale du batch sur 8 GPU H100.

Didacticiel

Description

Entraînement d'un modèle Transformer avec 10 millions de paramètres à l'aide de FSDP2

Ce Notebook illustre la formation distribuée d'un modèle Transformer de 10 millions de paramètres utilisant la bibliothèque FSDP2.

Entraînement du modèle OpenAI GPT-OSS 120B à l'aide de TRL et FSDP

Ce Notebook démontre comment exécuter l'affinement supervisé (SFT) sur un modèle GPT-OSS 120B en utilisant FSDP2 et la bibliothèque Transformer Reinforcement Learning (TRL). Cet exemple exploite FSDP pour réduire la consommation de mémoire et DDP pour monter en charge la taille globale du batch sur 8 GPU H100.