Configurez votre environnement
Aperçu
Cette fonctionnalité est en aperçu public.
Le Runtime d'IA offre deux environnements Python gérés pour le compute GPU serverless : un environnement Standard minimal avec torch, cuda et torchvision, et un environnement Databricks AI préchargé avec PyTorch, Transformers et d'autres frameworks de ML et de deep learning. Choisissez l’environnement Standard pour un contrôle total de votre pile de dépendances, ou l’environnement AI pour une configuration d’entraînement prête à l’emploi. Vous pouvez également start à partir de n’importe quel environnement et ajouter des packages avec %pip install.
Quel environnement utiliser
AI Runtime propose deux environnements Python gérés : l'environnement Standard et l'environnement Databricks AI.
Environnement | Principales caractéristiques | Quand utiliser |
|---|---|---|
Environnement Standard | Minimal ; inclut | Vous souhaitez un contrôle total sur votre pile de dépendances et préférez n'installer que ce dont vous avez besoin. |
Environnement Databricks AI | Préchargé avec des frameworks ML populaires (PyTorch, Transformers et bien d'autres) | Vous souhaitez un environnement complet pour l'entraînement, l'affinement et l'expérimentation sans gestion manuelle des dépendances. |
Vous pouvez également utiliser un environnement de base du Workspace qu'un administrateur de Workspace a conçu pour le compute de GPU Serverless. Consultez Créer pour le compute GPU serverless (Runtime AI).
Environnement standard (environnement minimal)
Un environnement minimal et stable contenant uniquement les packages requis pour le fonctionnement de l'IA Runtime. L'environnement inclut cuda pour la prise en charge du GPU. À partir de la version 5 de l'environnement, torch et torchvision ne sont plus préinstallés. Installez les versions dont votre charge de travail a besoin avec pip install. Pour les packages installés dans chaque version d'environnement, consultez les notes de version ci-dessous.
Idéal pour : les utilisateurs qui veulent un contrôle total sur leur pile de dépendances et préfèrent installer uniquement ce dont ils ont besoin.
Pour sélectionner : dans le panneau latéral Environnement , choisissez Standard v5 ou Standard v4 comme environnement de base.
Pour plus de détails sur les versions de package installées dans les différentes versions, consultez les notes de publication :
Environnement Databricks AI
Disponible dans l'environnement 4 et les versions ultérieures. L'environnement IA est construit sur l'environnement Standard avec des packages d'exécution communs et des packages spécifiques au machine learning sur les GPU. Les packages préinstallés incluent :
- PyTorch (avec prise en charge CUDA)
- Transformers (Hugging Face)
- Et dépendances ML/DL supplémentaires
Idéal pour : les praticiens en ML qui souhaitent un environnement complet pour les charges de travail de formation, l'affinement et l'expérimentation sans gestion manuelle des dépendances.
Pour sélectionner : dans le panneau latéral Environnement , choisissez AI v5 ou AI v4 comme environnement de base.
Pour plus de détails sur les versions de package installées dans les différentes versions, consultez les notes de publication :
Environnements de base du Workspace
Un administrateur de Workspace peut créer un environnement de base de Workspace pour le compute GPU Serverless, qui le rend disponible à tous les utilisateurs du Workspace via le menu déroulant Environnement de base . Pour plus de détails, consultez Concevoir pour le compute GPU serverless (AI Runtime).
Vous pouvez également configurer votre environnement de deep learning par projet en partant de l'un des environnements de base fournis (default ou Databricks AI) et en installant des packages supplémentaires par programmation à l'aide de %pip install dans votre Notebook ou en haut de votre script d'entraînement :
%pip install "trl==1.1.0"
%pip install "peft==0.19.1"
%pip install "transformers==5.5.4"
%pip install "fsspec==2024.9.0"
%pip install "huggingface_hub==1.11.0"
%pip install "datasets==3.2.0"
%pip install "accelerate==1.13.0"
Lorsque vous utilisez le décorateur @distributed pour les charges de travail multi-GPU, les packages installés avec %pip install avant d'appeler .distributed() sont automatiquement instantanés et propagés à tous les processus distribués. La taille totale des packages installés ne doit pas dépasser 15 Go.
Pour plus de détails, consultez Ajouter des dépendances au Notebook.
Mise en cache de l'environnement et modules personnalisés
Quand les environnements sont-ils mis en cache ?
Les environnements sont mis en cache entre les sessions pour accélérer les temps de Startup. Lorsque vous vous reconnectez à l’AI Runtime avec la même configuration d’environnement, les packages précédemment installés peuvent être disponibles à partir du cache, réduisant ainsi le temps de configuration.
Cependant, le comportement du cache n'est pas garanti, assurez-vous donc toujours que votre notebook inclut les commandes %pip install nécessaires à la reproductibilité.
Comment puis-je importer des modules personnalisés ?
Vous pouvez importer des modules personnalisés en les plaçant dans /Workspace/Shared et en ajoutant le chemin d'accès à sys.path:
import sys
sys.path.append("/Workspace/Shared/my-project/src")
from my_module import my_function
Vous pouvez également upload des fichiers de module en tant que fichiers Workspace et les importer directement. Pour la collaboration multi-utilisateur, stockez le code partagé dans /Workspace/Shared plutôt que dans des dossiers spécifiques à l'utilisateur. Pour le développement actif, utilisez des dossiers spécifiques à l'utilisateur et poussez vers un repository Git distant pour le contrôle de version.
Limitations
Les fonctionnalités suivantes ne sont pas disponibles sur AI Runtime :
- **Fonctions Spark** : Vous ne pouvez pas importer ou utiliser directement les fonctions PySpark. AI Runtime est un environnement Python uniquement ; Spark n'est pas disponible en tant que runtime local. Cependant, Spark Connect est disponible pour le chargement des données. Voir charger les données sur AI Runtime.
- **Bibliothèques ML de Databricks Runtime** : les packages préinstallés ne remplacent pas Databricks Runtime ML. Certaines bibliothèques ML disponibles dans Databricks Runtime ML peuvent ne pas être préinstallées sur l'AI Runtime.
- Artéfacts privés : AI Runtime prend en charge les artéfacts privés dans certains cas. Contactez l'équipe de votre compte pour plus de détails.