Formation distribuée multi-GPU
Bêta
Cette fonctionnalité est en Bêta. Les administrateurs du Workspace peuvent contrôler l'accès à cette fonctionnalité à partir de la page Previews . Consultez Gérer les aperçus Databricks.
Ces Notebooks permettent de monter en charge l'entraînement des modèles sur plusieurs GPU et nœuds sur AI Runtime. Elles couvrent les trois principales techniques de parallélisation, DDP, FSDP et DeepSpeed ZeRO, en utilisant l'API Python serverless_gpu sur les GPU H100.
L'entraînement distribué multi-GPU est pris en charge sur les GPU H100.
Choisissez votre technique de parallélisme
Lorsque vous faites passer l'entraînement de votre modèle à l’échelle sur plusieurs GPU, le choix de la bonne technique de parallélisme dépend de la taille de votre modèle, de la mémoire GPU disponible et des exigences de performance.
Technique | Quand utiliser |
|---|---|
DDP (Parallélisme de données distribué) | Le modèle complet tient dans une seule mémoire GPU ; il faut augmenter le throughput de données. |
FSDP (Fully Sharded Data Parallel) | Modèles très volumineux qui ne tiennent pas dans une seule mémoire GPU |
DeepSpeed ZeRO | Grands modèles avec des besoins d'optimisation avancée de la mémoire |
Pour des informations détaillées sur chaque technique, veuillez consulter DDP, FSDP et DeepSpeed.
Exemples de notebooks par technique et framework
Le tableau suivant organise des Notebooks d'exemple par le framework/la bibliothèque que vous utilisez et la technique de parallélisme appliquée. Plusieurs Notebooks peuvent apparaître dans une seule cellule.
Framework/Bibliothèque | Exemples DDP | Exemples FSDP | Exemples DeepSpeed |
|---|---|---|---|
PyTorch (natif) | — | ||
— | — | ||
— | — | ||
— | — | ||
— | — |
Get start
Utilisez les tutoriels suivants pour get start avec la bibliothèque Python de GPU Serverless pour la formation distribuée :
Didacticiel | Description |
|---|---|
Apprenez à utiliser Databricks AI Runtime avec des accélérateurs H100 pour exécuter des charges de travail GPU distribuées à l'aide de la bibliothèque Python serverless_gpu. |