Présentation
Aperçu
This feature is in Aperçu public.
AI Runtime est une offre de compute sur Databricks destinée aux workloads de deep learning, et apporte la prise en charge des GPU pour Databricks Serverless. Vous pouvez utiliser AI Runtime pour entraîner et affiner des modèles personnalisés à l’aide de vos frameworks favoris, et obtenir une efficacité, des performances et une qualité de pointe. Pour obtenir une vue d’ensemble de la manière dont le compute serverless s’intègre dans l’architecture Databricks, consultez Serverless workspace architecture.
Fonctionnalités clés
L'AI Runtime associe une infrastructure GPU managée à un runtime conçu pour le deep learning :
- Infrastructure GPU entièrement managée : un accès flexible et Serverless aux GPU, sans configuration de clusters, sélection de Driver ni politiques de mise à l'échelle automatique à gérer.
- Un runtime dédié au deep learning : choisissez entre un environnement Standard minimaliste pour une flexibilité maximale quant aux dépendances ou un environnement AI complet pré-équipé de frameworks ML populaires.
- Intégration native dans les notebooks, les jobs, Unity Catalog et MLflow pour un développement, un accès aux données et un suivi des expérimentations simplifiés.
Options de matériel
8xB300 est en cours d'aperçu public
L'entraînement sur des accélérateurs 8xB300 est disponible dans AWS, mais sur liste d'attente. Pour demander un accès, contactez l'équipe de votre compte Databricks ou votre représentant des ventes pour en savoir plus.
Tous les accélérateurs AI Runtime provisionnent un nœud unique. Le nombre de GPU sur ce nœud dépend du type d'accélérateur :
Accélérateur | GPU par nœud | Mémoire GPU | Idéal pour | Formation distribuée |
|---|---|---|---|---|
1xA10 | 1 | 24 Go | Tâches de ML et de deep learning de petite et moyenne envergure, telles que les modèles ML classiques ou l'affinement de modèles de langage plus petits | Non pris en charge (GPU unique) |
1xH100 | 1 | 80 Go | Charges de travail nécessitant plus de mémoire GPU que ce que fournit 1xA10, mais ne nécessitant pas d’entraînement distribué multi-GPU, telles que l’affinement de modèles de langage de taille moyenne | Non pris en charge (GPU unique) |
8xH100 | 8 | 80 Go par GPU | Charges de travail d'IA à grande échelle, comprenant l'entraînement ou l'affinement de modèles massifs ou l'exécution de tâches de deep learning avancées | Pris en charge à l’aide du décorateur |
8xB300 | 8 | 288 Go par GPU | Les modèles les plus grands et les longueurs de contexte les plus élevées. Les 288 Go de HBM par GPU permettent d’entraîner des modèles et des tailles de batch qui nécessiteraient autrement un déchargement processeur sur des GPU plus petits. | Pris en charge à l’aide du décorateur |
Seuls les modèles 8xH100 et 8xB300 prennent en charge l’entraînement distribué multi-GPU. Pour les charges de travail mon GPU, choisissez 1xA10 ou 1xH100 en fonction de la mémoire GPU nécessaire à votre modèle.
Cas d’utilisation
Databricks recommande l'utilisation d'AI Runtime pour tous les cas d'usage d'entraînement de modèles personnalisés impliquant du deep learning, des charges de travail classiques à grande échelle ou des processeurs graphiques (GPU).
Par exemple :
- Affinement des LLM (LoRA, QLoRA, affinement complet)
- Vision par ordinateur (détection d'objets, classification d'images)
- Systèmes de recommandation basés sur le deep learning
- Apprentissage par renforcement
- Prévisions de séries temporelles basées sur le deep learning
Requirements
Avant de start, confirmez que votre Workspace remplit ces conditions :
- Consultez Disponibilité de l'AI Runtime par Geo pour connaître les Geos prises en charge et les exigences en matière de traitement inter-Geo. La disponibilité du GPU varie selon le workspace.
- Un administrateur du workspace doit activer l'aperçu de l'AI Runtime dans les paramètres du workspace. Consultez Gérer les aperçus Databricks.
Limitations
Gardez à l'esprit les limitations suivantes lorsque vous planifiez une charge de travail AI Runtime :
-
L'AI Runtime prend uniquement en charge les accélérateurs A10, H100 et B300.
-
AI Runtime ne prend pas en charge le profil de sécurité de la conformité pour les normes FedRAMP High ou DoD IL5.
-
L’ajout de dépendances à l’aide du panneau Environments n’est pas pris en charge pour les Runtime jobs planifiés. Installez plutôt les dépendances par programmation à l’aide de
%pip installdans votre notebook. -
Pour les jobs planifiés sur AI Runtime, le comportement de récupération automatique pour les versions de package incompatibles qui sont associées à votre notebook n'est pas pris en charge.
-
Les tentatives de connexion à AI Runtime s’interrompent au bout de 15 minutes pour les notebooks interactifs et au bout de 24 heures pour les jobs de notebook ou les jobs CLI. Les sessions de notebook connectées et les jobs de notebook peuvent s’exécuter pendant un maximum de deux jours, et les jobs CLI peuvent s’exécuter pendant un maximum de 14 jours. Pour les jobs d’entraînement de modèle de longue durée, implémentez la création de points de contrôle (« checkpointing ») et redémarrez le job lorsque le runtime maximal est atteint.
-
AI Runtime offre un accès à la demande aux ressources GPU. Bien que cela permette un accès simple et flexible aux GPU, il peut y avoir des périodes où la capacité est limitée ou indisponible dans votre région.
-
AI Runtime exploite des GPU interrégionaux dans certains cas lors de pics de forte demande. Des coûts de sortie de données peuvent être associés à cette utilisation, et la connectivité réseau interrégionale peut être limitée à certains moments.
Se connecter à AI Runtime
Vous pouvez vous connecter à Runtime de manière interactive à partir de notebooks, d’un terminal IDE à l’aide d’un tunnel SSH, de jobs planifiés, de l’API Job et de Declarative Automation Bundles. Pour obtenir des instructions étape par étape, consultez Se connecter à Runtime depuis un notebook.
Configurer l’environnement
L'AI Runtime propose deux environnements Python managés : un environnement Standard minimal et un environnement Databricks AI complet préchargé avec des frameworks ML populaires tels que PyTorch et Transformers. Pour en savoir plus sur le choix d'un environnement, le comportement de la mise en cache, l'importation de modules personnalisés et les limitations connues, consultez Configurer votre environnement.
Choisissez l’environnement Standard pour un contrôle total de votre pile de dépendances, ou l’environnement Databricks AI pour ignorer l’installation de frameworks courants tels que PyTorch et Transformers.
Charger des données sur AI Runtime
Il est essentiel de comprendre le fonctionnement de l'accès aux données sur l'AI Runtime pour garantir une expérience fluide. Pour plus de détails, consultez Charger des données sur l'AI Runtime.
Entraînement distribué
AI Runtime prend en charge l’entraînement distribué sur plusieurs GPU sur le nœud unique auquel votre notebook est connecté. À l’aide du décorateur @distributed de l’API Python serverless_gpu, vous pouvez lancer des charges de travail multi-GPU avec PyTorch DDP, FSDP ou DeepSpeed en configurant un minimum de paramètres. Pour plus de détails, consultez la section Entraînement distribué dans les notebooks.
Validez votre charge de travail sur un seul GPU avant de passer à l'échelle supérieure avec 8xH100 à l'aide du décorateur @distributed.
Ray sur AI Runtime
AI Runtime prend en charge Ray pour les charges de travail GPU distribuées, notamment Ray Core, Ray Data, Ray Train et Ray Tune. Vous pouvez exécuter des jobs Ray à nœud unique et à plusieurs nœuds sur le compute GPU serverless sans configuration de cluster. Pour en savoir plus et consulter des exemples, voir Ray sur AI Runtime.
Suivi des Experimentation et observabilité
Pour l'intégration à MLflow, l'affichage des logs et le monitoring du GPU, consultez Suivi et observabilité des Experimentation. Pour la création de points de contrôle (checkpointing) de modèle, voir Améliorer les performances et la résilience de l'entraînement sur AI Runtime.
Mettre en production les charges de travail d'entraînement
Déployez une charge de travail AI Runtime avec Declarative Automation Bundles pour exécuter votre propre code d’entraînement, créer des jobs multifonctions combinant des tâches GPU et CPU, planifier des pipelines et effectuer une promotion du développement vers la production. Consultez Planifier des charges de travail GPU et composer des tâches.
Genie Code for deep learning
Genie Code peut aider à développer et à dépanner des charges de travail de deep learning sur AI Runtime. Il peut générer du code d’entraînement distribué, résoudre les problèmes d’environnement et de dépendances, et analyser les défaillances des charges de travail GPU et distribuées. Voir Utiliser Genie Code avec AI Runtime.
Guides
Pour la migration à partir de charges de travail classiques, d’exemples de Notebooks et de la résolution des problèmes, consultez les guides utilisateur pour AI Runtime. Pour transférer une charge de travail d’entraînement Slurm existante vers AI Runtime, consultez la section Migrer à partir de Slurm.