Qu'est-ce qu'AutoML ?
AutoML simplifie le processus d'application du Machine Learning à vos datasets en trouvant automatiquement le meilleur algorithme et la meilleure configuration d'hyperparamètres pour vous.
Dans Databricks Runtime 18,0 ML ou version supérieure, AutoML n'est pas inclus en tant que bibliothèque intégrée.
Comment fonctionne AutoML ?
Fournissez votre dataset et spécifiez le type de problème de Machine Learning, puis AutoML effectue les opérations suivantes :
- Nettoie et prépare vos données.
- Orchestre la formation de modèles distribués et l'ajustement des hyperparamètres sur plusieurs algorithmes.
- Trouve le meilleur modèle en utilisant des algorithmes d'évaluation open source de scikit-learn, xgboost, LightGBM, Prophet et ARIMA.
- Présente les résultats. AutoML génère également des Notebooks de code source pour chaque essai, ce qui vous permet de consulter, reproduire et modifier le code si nécessaire.
Démarrez avec les Experimentation AutoML via une interface utilisateur low-code pour la régression; la classification; ou la prévision, ou l’ API Python.
Exigences
-
AutoML dépend du package
databricks-automl-runtime, qui contient des composants utiles en dehors d'AutoML et contribue également à simplifier les notebooks générés par l'entraînement AutoML.databricks-automl-runtimeest disponible sur PyPI. -
Aucune bibliothèque supplémentaire autre que celles préinstallées dans Databricks Runtime for Machine Learning ne doit être installée sur le cluster.
- Toute modification (suppression, mises à niveau ou rétrogradations) des versions de bibliothèque existantes entraîne des échecs d'exécution en raison d'une incompatibilité.
-
Pour accéder aux fichiers dans votre Workspace, vous devez avoir les ports réseau 1017 et 1021 ouverts pour les expérimentations AutoML. Pour ouvrir ces ports ou confirmer qu'ils sont ouverts, examinez la configuration de votre pare-feu VPN cloud et les règles de votre groupe de sécurité ou contactez votre administrateur cloud local. Pour des informations supplémentaires sur la configuration et le déploiement du Workspace, voir Créer un workspace.
-
Utilisez une ressource de compute avec un mode d'accès compute pris en charge. Tous les modes d'accès au compute n'ont pas accès au Unity Catalog :
Mode d'accès Compute | Support AutoML | Prise en charge d'Unity Catalog |
|---|---|---|
Dédié (anciennement utilisateur unique) | Pris en charge | Pris en charge |
Standard (anciennement partagé) | Non pris en charge | Pris en charge |
Pas d'isolation partagée | Pris en charge | Non pris en charge |
Algorithmes AutoML
AutoML entraîne et évalue les modèles basés sur les algorithmes du tableau suivant.
Pour les modèles de classification et de régression, les algorithmes d’arbre de décision, de forêts aléatoires, de régression logistique et de régression linéaire avec descente de gradient stochastique sont basés sur scikit-learn.
Modèles de classification | Modèles de régression | Modèles de prévisions | Modèles de prévision (serverless) |
|---|---|---|---|
Auto-ARIMA (Disponible dans Databricks Runtime 10.3 ML et versions ultérieures.) | |||
Génération de Notebook d'évaluation
AutoML de compute classique génère des notebooks du code source issus des essais afin que vous puissiez examiner, reproduire et modifier le code si nécessaire.
Pour les expérimentations de prévision, les Notebooks générés par AutoML sont automatiquement importés dans votre Workspace pour tous les essais de votre expérimentation.
Pour les expérimentations de classification et de régression, les notebooks générés par AutoML pour l'exploration de données et la meilleure expérimentation de votre expérimentation sont automatiquement importés dans votre workspace. Les Notebooks générés pour d'autres essais d'expérience sont enregistrés en tant qu'artefacts MLflow sur DBFS au lieu d'être automatiquement importés dans votre Workspace. Pour toutes les expérimentations, à l’exception de la meilleure, les notebook_path et notebook_url de l’API Python TrialInfo ne sont pas définis. Si vous devez utiliser ces Notebooks, vous pouvez les importer manuellement dans votre Workspace avec l'interface utilisateur de l'Experimentation AutoML ou l'databricks.automl.import_notebook API Python.
Si vous utilisez uniquement le notebook d'exploration de données ou le meilleur notebook d'essai généré par AutoML, la colonne Source dans l'interface utilisateur d'expérimentation AutoML contient le Link vers le notebook généré pour le meilleur essai.
Si vous utilisez d'autres notebooks générés dans l'interface utilisateur d'Experimentation AutoML, ceux-ci ne sont pas automatiquement importés dans le Workspace. Vous pouvez trouver les notebooks en cliquant sur chaque exécution MLflow. Le notebook IPython est enregistré dans la section Artefacts de la page d'exécution. Vous pouvez download ce Notebook et l'importer dans le Workspace, si le download d'artefacts est activé par vos administrateurs de Workspace.
Valeurs Shapley (SHAP) pour l'explicabilité des modèles
Pour MLR 11.1 et versions antérieures, les tracés SHAP ne sont pas générés si le dataset contient une colonne datetime.
Les notebooks produits par les exécutions de régression et de classification AutoML incluent du code pour calculer les valeurs de Shapley. Les valeurs de Shapley sont basées sur la théorie des jeux et estiment l'importance de chaque fonctionnalité pour les prédictions d'un modèle.
Les notebooks AutoML calculent les valeurs de Shapley à l'aide du package SHAP. Ces calculs étant très gourmands en mémoire, ils ne sont pas effectués par default.
Pour calculer et afficher les valeurs Shapley :
- Accédez à la section Importance des fonctionnalités dans un Notebook d’essai généré par AutoML.
- Définir
shap_enabled = True. - Réexécutez le Notebook.