AI Runtime
Aperçu
Cette fonctionnalité est en aperçu public.
AI Runtime est une offre de compute Databricks destinée aux charges de travail de deep learning et apporte la prise en charge GPU pour Databricks Serverless. Vous pouvez utiliser AI Runtime pour entraîner et affiner des modèles personnalisés à l'aide de vos frameworks préférés et obtenir une efficacité, des performances et une qualité de pointe. Pour un aperçu de la façon dont le compute Serverless s'inscrit dans l'architecture Databricks, consultez l'architecture du Workspace Serverless.
Fonctionnalités clés
- Infrastructure GPU entièrement managée : accès Serverless et flexible aux GPU, sans configuration de clusters, sélection de Driver ou politiques de mise à l'échelle automatique à gérer.
- Un environnement d'exécution dédié à l'apprentissage profond : Choisissez soit un environnement Standard minimal pour une flexibilité maximale sur les dépendances, soit un environnement d'IA complet préchargé avec des frameworks ML populaires.
- Intégré en mode natif dans les Notebook, Jobs, Unity Catalog et MLflow pour un développement, un accès aux données et un suivi de l'Experimentation fluides.
- Prise en charge de la conformité : prend en charge la plupart des normes de conformité. Pour les normes prises en charge et les exceptions, consultez le profil de sécurité de la conformité.
Options matérielles
Tous les accélérateurs d'AI Runtime provisionnent un nœud unique. Le nombre de GPU sur ce nœud dépend du type d'accélérateur :
Accélérateur | GPU par nœud | Mémoire GPU | Idéal pour | Formation distribuée |
|---|---|---|---|---|
1xA10 | 1 | 24 Go | Tâches de ML et d'apprentissage profond de petite à moyenne taille, telles que les modèles ML classiques ou l'affinement de modèles de langage plus petits | Non pris en charge (GPU unique) |
1xH100 | 1 | 80 Go | Charges de travail qui nécessitent plus de mémoire GPU que celle fournie par 1xA10 mais ne nécessitent pas un entraînement distribué multi-GPU, comme l'affinement de modèles de langage de taille moyenne | Non pris en charge (GPU unique) |
8xH100 | 8 | 80 Go par GPU | Charges de travail d'IA à grande échelle, y compris l'entraînement ou l'affinement de modèles massifs ou l'exécution de tâches avancées d'apprentissage profond | Pris en charge à l’aide du décorateur |
Cas d'usage recommandés
Databricks recommande AI Runtime pour tous les cas d'utilisation de formation de modèles personnalisés impliquant l'apprentissage profond, les charges de travail classiques à grande échelle ou les GPU.
Par exemple :
- Affinement de LLM (LoRA, QLoRA, affinement complet)
- Vision par ordinateur (détection d'objets, classification d'images)
- Systèmes de recommandation basés sur le Deep Learning
- Apprentissage par renforcement
- Prévisions de séries chronologiques basées sur le deep learning
Exigences
-
Un Workspace dans l'une des régions AWS prises en charge suivantes :
us-west-2us-west-1us-east-1us-east-2ca-central-1sa-east-1
-
La préversion d’AI Runtime doit être activée via les paramètres d’administration du workspace. Consultez Gérer les aperçus Databricks.
Limitations
- Le Runtime de l'IA ne prend en charge que les accélérateurs A10 et H100.
- L’AI Runtime ne prend pas en charge le profil de sécurité de conformité pour les normes FedRAMP High ou DoD IL5. Toutes les autres normes de conformité sont prises en charge.
- L'ajout de dépendances à l'aide du panneau Environnements n'est pas pris en charge pour les Jobs planifiés de l'AI Runtime. Installez plutôt les dépendances par programme à l'aide de
%pip installdans votre Notebook. - Pour les Jobs planifiés sur le Runtime AI, le comportement de récupération automatique pour les versions de package incompatibles associées à votre Notebook n'est pas pris en charge.
- La durée d'exécution maximale pour une charge de travail est de sept jours. Pour les jobs d’entraînement de modèle qui dépassent cette limite, implémentez des points de contrôle et redémarrez le job une fois que la durée d’exécution maximale est atteinte.
- AI Runtime offre un accès à la demande aux ressources GPU. Bien que cela conduise à un accès facile et flexible aux GPU, il peut y avoir des périodes où la capacité est limitée ou indisponible dans votre région.
- AI Runtime exploite les GPU interrégionaux dans certains cas, en période de forte demande. L'utilisation de ces services peut entraîner des coûts d'évacuation et la connectivité réseau interrégionale peut être limitée à certains moments.
Se connecter à l'IA Runtime
Vous pouvez vous connecter à l'AI Runtime de manière interactive à partir de Notebook, d'un terminal IDE utilisant un tunnel SSH, de Jobs planifiés, de l'API Jobs et de bundles d'automatisation déclaratifs. Pour des instructions étape par étape, consultez Connecter au Runtime d'IA.
Configurer l'environnement
Le Runtime AI offre deux environnements Python gérés : un environnement Standard minimal et un environnement Databricks AI complet qui est préchargé avec des frameworks ML populaires comme PyTorch et Transformers. Pour plus de détails sur le choix d’un environnement, le comportement de mise en cache, l’importation de modules personnalisés et les limites connues, consultez Configurer votre environnement.
Charger des données sur AI Runtime
Comprendre comment l'accès aux données fonctionne sur AI Runtime est essentiel pour une expérience fluide. Pour plus de détails, consultez Charger des données sur l'AI Runtime.
Entraînement distribué
AI Runtime prend en charge l'entraînement distribué sur plusieurs GPU sur le nœud unique auquel votre notebook est connecté. En utilisant le décorateur @distributed de l'API Python serverless_gpu, vous pouvez lancer des charges de travail multi-GPU avec PyTorch DDP, FSDP ou DeepSpeed avec une configuration minimale. Pour plus de détails, consultez Formation distribuée dans les notebooks.
Suivi des Experimentation et observabilité
Pour l'intégration MLflow, l'affichage des Logs et la gestion des checkpoints de modèle, consultez Suivi des Expérimentations et observabilité.
Genie Code pour l'apprentissage profond
Genie Code prend en charge les charges de travail de deep learning sur l’AI Runtime. Il peut aider à générer du code d'entraînement, à résoudre les erreurs d'installation de bibliothèque, à suggérer des optimisations et à debugging les problèmes courants. Voir Utiliser Genie Code pour la data science.
Guides
Pour la migration des charges de travail classiques, des exemples de notebooks et le dépannage, consultez les guides de l'utilisateur pour AI Runtime.