Configurez votre environnement
Aperçu
Cette fonctionnalité est en aperçu public.
AI Runtime fournit deux environnements Python gérés pour le compute GPU serverless. L’environnement Standard inclut cuda. À partir de la version d’environnement 5, torch et torchvision ne sont plus préinstallés. L’environnement Databricks AI est préchargé avec PyTorch, Transformers et d’autres frameworks de deep learning et de ML. Choisissez l’environnement Standard pour un contrôle total sur votre pile de dépendances, ou l’environnement AI pour une configuration d’entraînement prête à l’emploi. Vous pouvez start à partir de l’un ou l’autre environnement et installer vous-même d’autres packages.
Principaux points à retenir
- Choisissez l’environnement Standard pour un contrôle total sur les dépendances, ou l’environnement Databricks AI pour une pile de ML prête à l’emploi.
- Standard inclut
cuda. À partir de la version d’environnement 5,torchettorchvisionne sont pas préinstallés. L’environnement d’IA ajoute PyTorch, Transformers et bien plus encore. - Installez plus de packages avec
%uv pip install(version d’environnement 5 et supérieure) ou%pip installdans un notebook, ou avecenvironment.dependenciesdans la CLI.
Quel environnement utiliser
AI Runtime propose deux environnements Python gérés : l'environnement Standard et l'environnement Databricks AI.
Environnement | Principales caractéristiques | Quand utiliser |
|---|---|---|
Environnement Standard | Minimal ; inclut | Vous souhaitez un contrôle total sur votre pile de dépendances et préférez n'installer que ce dont vous avez besoin. |
Environnement Databricks AI | Préchargé avec des frameworks ML populaires (PyTorch, Transformers et bien d'autres) | Vous souhaitez un environnement complet pour l'entraînement, l'affinement et l'expérimentation sans gestion manuelle des dépendances. |
Vous pouvez également utiliser un environnement de base de workspace qu’un administrateur de workspace a conçu pour AI Runtime. Voir Conception pour le compute serverless GPU (AI Runtime).
Pour choisir un environnement dans un notebook, ouvrez le panneau latéral Environment et sélectionnez un environnement de base:

Environnement standard (environnement minimal)
Environnement minimal et stable contenant uniquement les packages requis pour l’opération Runtime. L’environnement inclut cuda pour la prise en charge du GPU. À partir de la version 5 de l’environnement, torch et torchvision ne sont plus préinstallés. Installez les versions requises par votre charge de travail avec %uv pip install ou %pip install. Pour connaître les packages installés dans chaque version d’environnement, consultez les notes de version ci-dessous.
Idéal pour : les utilisateurs qui veulent un contrôle total sur leur pile de dépendances et préfèrent installer uniquement ce dont ils ont besoin.
Pour sélectionner : dans le panneau latéral Environnement , choisissez Standard v6 comme environnement de base.
Pour plus de détails sur les versions de package installées dans les différentes versions, consultez les notes de publication :
Environnement Databricks AI
Disponible dans l'environnement 4 et les versions ultérieures. L'environnement IA est construit sur l'environnement Standard avec des packages d'exécution communs et des packages spécifiques au machine learning sur les GPU. Les packages préinstallés incluent :
- PyTorch (avec prise en charge CUDA)
- Transformers (Hugging Face)
- Et dépendances ML/DL supplémentaires
Idéal pour : les praticiens en ML qui souhaitent un environnement complet pour les charges de travail de formation, l'affinement et l'expérimentation sans gestion manuelle des dépendances.
Pour sélectionner : dans le panneau latéral Environment , choisissez AI v6 comme environnement de base.
Pour plus de détails sur les versions de package installées dans les différentes versions, consultez les notes de publication :
Installer des packages supplémentaires
Vous pouvez start à partir d’un environnement géré ou d’un environnement de base de workspace, puis installer vos propres packages Python par-dessus. La manière de les installer dépend de votre mode de connexion à AI Runtime.
Dans un notebook
Installez les packages en haut de votre notebook ou de votre script d’entraînement avec %uv pip, qui s’installe avec uv et est plus rapide que %pip. Pin les versions pour que les exécutions restent reproductibles :
%uv pip install "trl==1.1.0"
%uv pip install "transformers==5.5.4"
Pour obtenir la référence complète sur %pip et %uv pip, y compris les versions d’environnement qui les prennent en charge, consultez Gérer des bibliothèques avec des commandes %uv.
Lorsque vous utilisez le décorateur @distributed pour des charges de travail multi-GPU, les packages que vous installez avant d’appeler .distributed() sont automatiquement enregistrés sous forme d’instantané et propagés à tous les processus distribués. La taille totale des packages installés ne doit pas dépasser 15 Go. Pour en savoir plus, consultez Ajouter des dépendances au notebook.
Avec la CLI
La air CLI utilise les mêmes environnements gérés. Sélectionnez-en un avec environment.version, puis répertoriez les packages à installer par-dessus sous environment.dependencies dans le fichier YAML de votre charge de travail. La CLI les installe dans l’environnement sélectionné avec uv, de sorte que vous n’avez pas à gérer vous-même un environnement virtuel distinct :
environment:
version: '6'
dependencies:
- trl==1.1.0
- transformers==5.5.4
Pour start à partir de l’environnement Databricks AI à la place, définissez version sur un identifiant d’environnement d’IA tel que databricks_ai_v5. Pour en savoir plus sur le format complet des dépendances, les indicateurs d’installation pris en charge et la prise en charge des images Docker personnalisées, consultez Dépendances Python.
Environnements de base du Workspace
Un administrateur de Workspace peut créer un environnement de base de Workspace pour le compute GPU Serverless, qui le rend disponible à tous les utilisateurs du Workspace via le menu déroulant Environnement de base . Pour plus de détails, consultez Concevoir pour le compute GPU serverless (AI Runtime).
Pour utiliser un environnement de base dans une charge de travail planifiée, faites-y référence par son identifiant dans le bloc environments d’un job ou d’un bundle. Par exemple, cette tâche Declarative Automation Bundles sélectionne l’environnement Databricks AI :
resources:
jobs:
train:
tasks:
- task_key: train
environment_key: default
environments:
- environment_key: default
spec:
base_environment: databricks_ai_v6
Pour obtenir un exemple de job complet, consultez Planifier avec l’API Jobs et Declarative Automation Bundles.
Mise en cache de l'environnement et modules personnalisés
Quand les environnements sont-ils mis en cache ?
AI Runtime met en cache l’environnement de votre notebook. Ainsi, lorsque vous rouvrez le notebook, vous n’avez pas besoin de réinstaller de packages. Pour plus de détails, voir Reset les dépendances de l’environnement.
La mise en cache s’applique aux notebooks interactifs. Les charges de travail exécutées via la CLIair ou planifiées en tant que jobs n’utilisent pas ce cache ; chaque exécution installe ses dépendances à neuf.
Par bonne pratique, pin les packages à une version spécifique afin que votre environnement mis en cache reste valide et que vos exécutions restent reproductibles.
Comment puis-je importer des modules personnalisés ?
Les étapes suivantes montrent comment utiliser vos propres modules Python.
- Synchronisez votre code sur le workspace. Clonez un repository Git dans le Workspace avec un dossier Git, ouuplatez les fichiers directement en tant que fichiers du Workspace. Stockez le code partagé sous
/Workspace/Sharedpour les projets d’équipe, ou dans un dossier utilisateur pour le développement personnel. Conserver le code dans un dossier Git permet de conserver le contrôle des versions. - Ajoutez le dossier à
sys.pathet importez-le en haut de votre notebook ou de votre script d'entraînement :
import sys
sys.path.append("/Workspace/Shared/my-project/src")
from my_module import my_function
Limitations
Les fonctionnalités suivantes ne sont pas disponibles sur AI Runtime :
- **Fonctions Spark** : Vous ne pouvez pas importer ou utiliser directement les fonctions PySpark. AI Runtime est un environnement Python uniquement ; Spark n'est pas disponible en tant que runtime local. Cependant, Spark Connect est disponible pour le chargement des données. Voir charger les données sur AI Runtime.
- **Bibliothèques ML de Databricks Runtime** : les packages préinstallés ne remplacent pas Databricks Runtime ML. Certaines bibliothèques ML disponibles dans Databricks Runtime ML peuvent ne pas être préinstallées sur l'AI Runtime.
- Artéfacts privés : AI Runtime prend en charge les artéfacts privés dans certains cas. Contactez l'équipe de votre compte pour plus de détails.