Régression avec AutoML
Utilisez AutoML pour trouver automatiquement le meilleur algorithme de régression et la meilleure configuration d'hyperparamètres afin de prédire des valeurs numériques continues.
Configurer l'Experimentation de régression avec l'interface utilisateur
Vous pouvez configurer un problème de régression à l'aide de l'interface utilisateur d'AutoML en suivant les étapes suivantes :
-
Dans la barre latérale, sélectionnez **Experimentation**.
-
Dans la carte Régression , sélectionnez Start l'entraînement .
La page **Configurer l'expérimentation AutoML** s'affiche. Sur cette page, vous configurez le processus AutoML, en spécifiant le dataset, le type de problème, la colonne cible ou d'étiquette à prédire, la métrique à utiliser pour évaluer et noter les exécutions d'expérimentation, et les conditions d'arrêt.
-
Dans le champ Compute , sélectionnez un cluster exécutant Databricks Runtime ML.
-
Sous Dataset , sélectionnez Parcourir .
-
Naviguez jusqu'à la table que vous souhaitez utiliser et cliquez sur Sélectionner . Le schéma de la table apparaît.
- Dans Databricks Runtime 10.3 ML et versions supérieures, vous pouvez spécifier les colonnes qu'AutoML doit utiliser pour l'entraînement. Vous ne pouvez pas supprimer la colonne sélectionnée comme cible de prédiction ou la colonne temporelle pour diviser les données.
- Dans Databricks Runtime 10.4 LTS ML et versions ultérieures, vous pouvez spécifier comment les valeurs nulles sont imputées en sélectionnant dans le menu déroulant Imputer avec . Par default, AutoML sélectionne une méthode d'imputation basée sur le type et le contenu de la colonne.
Si vous spécifiez une méthode d'imputation non-default, AutoML n'effectue pas de détection de type sémantique.
-
Cliquez dans le champ Objectif de prédiction . Une liste déroulante apparaît, répertoriant les colonnes affichées dans le schéma. Sélectionnez la colonne que vous voulez que le modèle prédise.
-
Le champ Nom de l'expérimentation affiche le nom par default. Pour le modifier, saisissez le nouveau nom dans le champ.
Vous pouvez également :
- Spécifiez les options de configuration supplémentaires.
- Utilisez les tables de fonctionnalités existantes dans le Magasin de fonctionnalités pour enrichir le dataset d'entrée d'origine.
Configurations avancées
Ouvrez la section **Configuration avancée (facultatif)** pour accéder à ces paramètres.
-
La métrique d'évaluation est la métrique principale utilisée pour noter les exécutions.
-
Dans Databricks Runtime 10.4 LTS ML et versions ultérieures, vous pouvez exclure les frameworks d'entraînement. Par default, AutoML entraîne des modèles en utilisant les frameworks listés sous algorithmes AutoML.
-
Vous pouvez modifier les conditions d'arrêt. Les conditions d'arrêt default sont :
- Pour les expérimentations de prévision, arrêtez-vous après 120 minutes.
- Dans Databricks Runtime 10.4 LTS ML et versions antérieures, pour les expérimentations de classification et de régression, l'arrêt se produit après 60 minutes ou après avoir terminé 200 essais, selon la première éventualité. Pour Databricks Runtime 11.0 ML et versions ultérieures, le nombre d'essais n'est pas utilisé comme condition d'arrêt.
- Dans Databricks Runtime 10.4 LTS ML et versions ultérieures, pour les expérimentations de classification et de régression, AutoML intègre l'arrêt anticipé ; il arrête l'entraînement et l'ajustement des modèles si la métrique de validation ne s'améliore plus.
-
Dans Databricks Runtime 10.4 LTS ML et versions ultérieures, vous pouvez sélectionner un
time columnpour répartir les données pour l'apprentissage, la validation et les tests dans l'ordre chronologique (s'applique uniquement à la classification et à la régression). -
Databricks recommande de laisser le champ Répertoire de données vide. Le fait de ne pas renseigner ce champ déclenche le comportement par default de stockage sécurisé du dataset en tant qu'artefact MLflow. Un chemin DBFS peut être spécifié, mais dans ce cas, le dataset n'hérite pas des autorisations d'accès de l'Experimentation AutoML.
Exécuter l'experimentation et surveiller les résultats
Pour start l’Expérimentation AutoML, cliquez sur start AutoML . L’Expérimentation start à s’exécuter, et la page d’entraînement AutoML apparaît. Pour refresh la table des exécutions, cliquez sur .
Afficher la progression de l'expérimentation
À partir de cette page, vous pouvez :
- Arrêtez l'expérience à tout moment.
- Ouvrir le Notebook d’exploration des données.
- Superviser les exécutions.
- Accédez à la page d'exécution pour toute exécution.
Avec Databricks Runtime 10.1 ML et versions ultérieures, AutoML affiche des avertissements pour les problèmes potentiels avec le dataset, tels que les types de colonnes non pris en charge ou les colonnes à forte cardinalité.
Databricks fait de son mieux pour indiquer les erreurs ou problèmes potentiels. Cependant, cela pourrait ne pas être exhaustif et pourrait ne pas couvrir les problèmes ou erreurs que vous recherchez.
Pour afficher les avertissements concernant le dataset, cliquez sur la **tab Avertissements** de la page d'entraînement ou de la page d'expérimentation une fois l'expérimentation terminée.

Afficher les résultats
Lorsque l'expérimentation est terminée, vous pouvez :
- Enregistrez et déployez l'un des modèles avec MLflow.
- Sélectionnez **Afficher le Notebook du meilleur modèle** pour examiner et modifier le Notebook qui a créé le meilleur modèle.
- Sélectionnez **Consulter le notebook d'exploration des données** pour ouvrir le notebook d'exploration des données.
- Recherchez, filtrez et triez les exécutions dans la table des exécutions.
- Consultez les détails pour toute exécution :
- Le Notebook généré contenant le code source pour un essai est accessible en cliquant sur l’exécution MLflow. Le Notebook est enregistré dans la section **Artifacts** de la page d'exécution. Vous pouvez download ce Notebook et l’importer dans le Workspace, si le download des artefacts est activé par les administrateurs de votre Workspace.
- Pour afficher les résultats de l'exécution, cliquez dans la colonne Modèles ou la colonne Heure de start . La page d'exécution apparaît, affichant les informations sur l'exécution d'essai (telles que les parameter, les métriques et les balises) et les artefacts créés par l'exécution, y compris le modèle. Cette page comprend également des extraits de code que vous pouvez utiliser pour faire des prédictions avec le modèle.
Pour revenir ultérieurement à cette expérimentation AutoML, retrouvez-la dans le tableau de la page Expérimentations. Les résultats de chaque expérimentation AutoML, y compris l'exploration de données et les Notebooks d'entraînement, sont stockés dans un dossier databricks_automl du dossier personnel de l'utilisateur qui a exécuté l'expérimentation.
Enregistrer et déployer un modèle
Enregistrez et déployez votre modèle à l'aide de l'interface utilisateur d'AutoML. Lorsqu'une exécution se termine, la première ligne affiche le meilleur modèle basé sur la métrique principale.
-
Sélectionnez le Link dans la colonne Modèles pour le modèle que vous souhaitez enregistrer.
-
Sélectionnez
pour l'enregistrer dans Unity Catalog ou dans le Model Registry.
Databricks vous recommande d'enregistrer les modèles dans Unity Catalog pour bénéficier des dernières fonctionnalités.
- Après l'enregistrement, vous pouvez déployer le modèle sur un endpoint de mise en service du modèle personnalisé.
Aucun module nommé 'pandas.core.indexes.numeric
Lorsque vous déployez un modèle construit à l'aide d'AutoML avec Model Serving, vous pouvez obtenir l'erreur : No module named 'pandas.core.indexes.numeric.
Ceci est dû à une version pandas incompatible entre AutoML et l'environnement de l'Endpoint de service de modèles. Vous pouvez résoudre cette erreur en exécutant le script add-pandas-dependency.py. Le script modifie les requirements.txt et conda.yaml de votre modèle enregistré afin d'inclure la version de dépendance pandas appropriée : pandas==1.5.3
- Modifiez le script pour inclure le
run_idde l'exécution MLflow où votre modèle a été enregistré. - Réenregistrez le modèle dans Unity Catalog ou dans le registre de modèles.
- Essayez de déployer la nouvelle version du modèle MLflow.