Entraîner les modèles d'IA et de ML
Databricks offre des solutions de compute flexibles adaptées aux différents besoins du Machine Learning, allant des runtimes de clusters gérés aux environnements GPU entièrement serverless.
-
- AI Runtime
- Environnement de compute GPU Serverless optimisé pour les charges de travail de deep learning personnalisées à nœud unique et multi-nœuds.
-
- Databricks Runtime pour le machine learning
- Environnement de compute classique avec des bibliothèques pré-intégrées pour les charges de travail de Machine Learning classique et de deep learning.
AI Runtime (Aperçu)
Aperçu
Cette fonctionnalité est en aperçu public.
L'AI Runtime est une offre spécialisée au sein de l'écosystème serverless de Databricks. Il est optimisé pour les charges de travail de deep learning mononœud et multinœud personnalisées, telles que l'affinement des LLM ou la formation de modèles de vision par ordinateur. Pour un aperçu de la façon dont le compute Serverless s'inscrit dans l'architecture Databricks, consultez l'architecture du Workspace Serverless.
Les principales fonctionnalités incluent :
- Disponibilité instantanée : Élimine la nécessité de gérer l'infrastructure de cluster sous-jacente, vous permettant de connecter un Notebook directement aux ressources GPU serverless.
- Matériel haute performance : Offre un accès aux GPU A10 pour les tâches économiques et aux GPU H100 pour les charges de travail IA à grande échelle.
- Environnements gérés : propose un environnement de base default pour une personnalisation complète ou un environnement d'IA préchargé avec des packages de ML courants comme Transformers et Ray.
- **Mise à l'échelle flexible** : Prend en charge la formation distribuée sur plusieurs GPU et nœuds.
Databricks Runtime for Machine Learning
Databricks Runtime for Machine Learning est un runtime spécialisé qui automatise la création de ressources de compute avec une infrastructure préétablie. Il est conçu pour les utilisateurs qui souhaitent un environnement complet et prêt à l'emploi pour le Machine Learning classique et le deep learning.
Les principales fonctionnalités incluent :
- Bibliothèques préinstallées : Comprend des bibliothèques populaires comme PyTorch, TensorFlow et XGBoost, qui reçoivent des mises à jour fréquentes et un support optimisé.
- Polyvalence du compute : Prend en charge les types d'instances basés sur le CPU et le GPU, y compris AWS Graviton pour un meilleur rapport prix/performances.
- **Optimisation** : Offre une intégration avec Photon pour accélérer les tâches Spark SQL, DataFrames et d’ingénierie des fonctionnalités.
- Contrôle d'accès : Nécessite un mode d'accès dédié pour un accès sécurisé aux données via Unity Catalog.