Entraînement distribué avec DeepSpeed distributor
Cet article décrit comment effectuer une formation distribuée sur des modèles de ML PyTorch à l'aide du distributeur DeepSpeed.
Le distributeur DeepSpeed est basé sur TorchDistributor et est une solution recommandée pour les clients disposant de modèles qui nécessitent une puissance de compute plus élevée, mais qui sont limités par des contraintes de mémoire.
La bibliothèque DeepSpeed est une bibliothèque open source développée par Microsoft et est disponible dans Databricks Runtime 14.0 ML et versions ultérieures. Il offre une utilisation optimisée de la mémoire, une réduction de la charge de communication et un parallélisme de pipeline avancé qui permettent une mise à l'échelle des modèles et des procédures d'entraînement qui seraient autrement inatteignables sur du matériel standard.
Voici des scénarios d'exemple où le distributeur DeepSpeed est bénéfique :
- Mémoire GPU faible.
- Entraînement de grands modèles.
- Grandes données d'entrée, comme lors de l'inférence par batch.
Exemple de Notebook pour la formation distribuée avec DeepSpeed
L'exemple de Notebook suivant montre comment effectuer un entraînement distribué avec DeepSpeed distributor.