Présentation
Aperçu
This feature is in Aperçu public.
AI Runtime est une offre de compute sur Databricks destinée aux workloads de deep learning, et apporte la prise en charge des GPU pour Databricks Serverless. Vous pouvez utiliser AI Runtime pour entraîner et affiner des modèles personnalisés à l’aide de vos frameworks favoris, et obtenir une efficacité, des performances et une qualité de pointe. Pour obtenir une vue d’ensemble de la manière dont le compute serverless s’intègre dans l’architecture Databricks, consultez Serverless workspace architecture.
Fonctionnalités clés
L'AI Runtime associe une infrastructure GPU managée à un runtime conçu pour le deep learning :
- Infrastructure GPU entièrement managée : un accès flexible et Serverless aux GPU, sans configuration de clusters, sélection de Driver ni politiques de mise à l'échelle automatique à gérer.
- Un runtime dédié au deep learning : choisissez entre un environnement Standard minimaliste pour une flexibilité maximale quant aux dépendances ou un environnement AI complet pré-équipé de frameworks ML populaires.
- Intégration native dans les notebooks, les jobs, Unity Catalog et MLflow pour un développement, un accès aux données et un suivi des expérimentations simplifiés.
Options de matériel
Tous les accélérateurs AI Runtime provisionnent un nœud unique. Le nombre de GPU sur ce nœud dépend du type d'accélérateur :
Accélérateur | GPU par nœud | Mémoire GPU | Idéal pour | Formation distribuée |
|---|---|---|---|---|
1xA10 | 1 | 24 Go | Tâches de ML et de deep learning de petite et moyenne envergure, telles que les modèles ML classiques ou l'affinement de modèles de langage plus petits | Non pris en charge (GPU unique) |
1xH100 | 1 | 80 Go | Charges de travail nécessitant plus de mémoire GPU que ce que fournit 1xA10, mais ne nécessitant pas d’entraînement distribué multi-GPU, telles que l’affinement de modèles de langage de taille moyenne | Non pris en charge (GPU unique) |
8xH100 | 8 | 80 Go par GPU | Charges de travail d'IA à grande échelle, comprenant l'entraînement ou l'affinement de modèles massifs ou l'exécution de tâches de deep learning avancées | Pris en charge à l’aide du décorateur |
Seul 8xH100 prend en charge l'entraînement distribué multi-GPU. Pour les charges de travail à GPU unique, choisissez 1xA10 ou 1xH100 en fonction de la mémoire GPU requise par votre modèle.
Cas d’utilisation
Databricks recommande l'utilisation d'AI Runtime pour tous les cas d'usage d'entraînement de modèles personnalisés impliquant du deep learning, des charges de travail classiques à grande échelle ou des processeurs graphiques (GPU).
Par exemple :
- Affinement des LLM (LoRA, QLoRA, affinement complet)
- Vision par ordinateur (détection d'objets, classification d'images)
- Systèmes de recommandation basés sur le deep learning
- Apprentissage par renforcement
- Prévisions de séries temporelles basées sur le deep learning
Requirements
Avant de start, confirmez que votre Workspace remplit ces conditions :
-
Un workspace dans l'une des régions prises en charge par AWS :
us-west-2us-west-1us-east-1us-east-2ca-central-1sa-east-1
-
L'aperçu d'AI Runtime doit être activé via les paramètres d'administration du workspace. Consultez Gérer les aperçus Databricks.
Limitations
Gardez à l'esprit les limitations suivantes lorsque vous planifiez une charge de travail AI Runtime :
- L'AI Runtime prend uniquement en charge les accélérateurs A10 et H100.
- AI Runtime ne prend pas en charge le profil de sécurité de la conformité pour les normes FedRAMP High ou DoD IL5.
- L’ajout de dépendances à l’aide du panneau Environments n’est pas pris en charge pour les Runtime jobs planifiés. Installez plutôt les dépendances par programmation à l’aide de
%pip installdans votre notebook. - Pour les jobs planifiés sur AI Runtime, le comportement de récupération automatique pour les versions de package incompatibles qui sont associées à votre notebook n'est pas pris en charge.
- Les tentatives de connexion à AI Runtime s’interrompent au bout de 15 minutes pour les notebooks interactifs et au bout de 24 heures pour les jobs de notebook ou les jobs CLI. Les sessions de notebook connectées et les jobs de notebook peuvent s’exécuter pendant un maximum de deux jours, et les jobs CLI peuvent s’exécuter pendant un maximum de 14 jours. Pour les jobs d’entraînement de modèle de longue durée, implémentez la création de points de contrôle (« checkpointing ») et redémarrez le job lorsque le runtime maximal est atteint.
- AI Runtime offre un accès à la demande aux ressources GPU. Bien que cela permette un accès simple et flexible aux GPU, il peut y avoir des périodes où la capacité est limitée ou indisponible dans votre région.
- AI Runtime exploite des GPU interrégionaux dans certains cas lors de pics de forte demande. Des coûts de sortie de données peuvent être associés à cette utilisation, et la connectivité réseau interrégionale peut être limitée à certains moments.
Se connecter à AI Runtime
Vous pouvez vous connecter à AI Runtime de manière interactive à partir de notebooks, d'un terminal IDE à l'aide d'un tunnel SSH, de jobs planifiés, de l'API Jobs et de Declarative Automation Bundles. Pour obtenir des instructions étape par étape, consultez Se connecter à AI Runtime.
Configurer l’environnement
L'AI Runtime propose deux environnements Python managés : un environnement Standard minimal et un environnement Databricks AI complet préchargé avec des frameworks ML populaires tels que PyTorch et Transformers. Pour en savoir plus sur le choix d'un environnement, le comportement de la mise en cache, l'importation de modules personnalisés et les limitations connues, consultez Configurer votre environnement.
Choisissez l’environnement Standard pour un contrôle total de votre pile de dépendances, ou l’environnement Databricks AI pour ignorer l’installation de frameworks courants tels que PyTorch et Transformers.
Charger des données sur AI Runtime
Il est essentiel de comprendre le fonctionnement de l'accès aux données sur l'AI Runtime pour garantir une expérience fluide. Pour plus de détails, consultez Charger des données sur l'AI Runtime.
Entraînement distribué
AI Runtime prend en charge l’entraînement distribué sur plusieurs GPU sur le nœud unique auquel votre notebook est connecté. À l’aide du décorateur @distributed de l’API Python serverless_gpu, vous pouvez lancer des charges de travail multi-GPU avec PyTorch DDP, FSDP ou DeepSpeed en configurant un minimum de paramètres. Pour plus de détails, consultez la section Entraînement distribué dans les notebooks.
Validez votre charge de travail sur un seul GPU avant de passer à l'échelle supérieure avec 8xH100 à l'aide du décorateur @distributed.
Ray sur AI Runtime
AI Runtime prend en charge Ray pour les charges de travail GPU distribuées, notamment Ray Core, Ray Data, Ray Train et Ray Tune. Vous pouvez exécuter des jobs Ray à nœud unique et à plusieurs nœuds sur le compute GPU serverless sans configuration de cluster. Pour en savoir plus et consulter des exemples, voir Ray sur AI Runtime.
Suivi des Experimentation et observabilité
Pour en savoir plus sur l'intégration de MLflow, la visualisation des Logs et la gestion des points de contrôle des modèles, consultez Suivi des Experimentation et observabilité.
Mettre en production les charges de travail d'entraînement
Déployez une charge de travail AI Runtime avec Declarative Automation Bundles pour exécuter votre propre code d'entraînement, créer des jobs multifonctions combinant des tâches GPU et CPU, planifier des pipelines et passer du développement à la production. Consultez Productionize training workloads.
Genie Code for deep learning
Genie Code peut aider à développer et à dépanner des charges de travail de deep learning sur AI Runtime. Il peut générer du code d’entraînement distribué, résoudre les problèmes d’environnement et de dépendances, et analyser les défaillances des charges de travail GPU et distribuées. Voir Utiliser Genie Code avec AI Runtime.
Guides
Pour en savoir plus sur la migration à partir de charges de travail classiques, les exemples de notebooks et le dépannage, consultez les guides utilisateur d'AI Runtime.