Aller au contenu principal

Prévisions avec AutoML (classic compute)

Utilisez AutoML pour trouver automatiquement le meilleur algorithme de prévision et la meilleure configuration d'hyperparamètres afin de prédire des valeurs basées sur des données de séries chronologiques.

La prévision des séries chronologiques n'est disponible que pour Databricks Runtime 10.0 ML ou version ultérieure.

Configurez l'expérimentation de prévision avec l'interface utilisateur

Vous pouvez configurer un problème de prévision à l'aide de l'interface utilisateur d'AutoML en suivant les étapes suivantes :

  1. Dans la barre latérale, sélectionnez **Experimentation**.
  2. Dans la carte Forecasting , sélectionnez Start la formation .

L'interface utilisateur de prévision utilise par default forecasting serverless. Pour accéder à la prévision avec votre propre compute, sélectionnez revenir à l'ancienne expérience .

Configurer l'Experimentation AutoML

  1. La page **Configurer l'expérimentation AutoML** s'affiche. Sur cette page, vous configurez le processus AutoML, en spécifiant le dataset, le type de problème, la colonne cible ou d'étiquette à prédire, la métrique à utiliser pour évaluer et noter les exécutions d'expérimentation, et les conditions d'arrêt.

  2. Dans le champ Compute , sélectionnez un cluster exécutant Databricks Runtime 10.0 ML ou une version ultérieure.

  3. Sous dataset , cliquez sur Parcourir . Naviguez jusqu'à la table que vous souhaitez utiliser et cliquez sur Sélectionner . Le schéma de la table apparaît.

  4. Cliquez dans le champ Objectif de prédiction . Un menu déroulant apparaît, listant les colonnes affichées dans le schéma. Sélectionnez la colonne que vous voulez que le modèle prédise.

  5. Cliquez dans le champ **Colonne d'heure**. Un menu déroulant apparaît, affichant les colonnes du dataset qui sont de type timestamp ou date. Sélectionnez la colonne contenant les périodes de temps pour la série temporelle.

  6. Pour la prévision multi-séries, sélectionnez la ou les colonnes qui identifient les séries chronologiques individuelles dans la liste déroulante Identifiants de série chronologique . AutoML regroupe les données par ces colonnes en différentes séries chronologiques et entraîne un modèle pour chaque série indépendamment. Si vous laissez ce champ vide, AutoML suppose que le dataset contient une seule série chronologique.

  7. Dans les champs **Horizon et fréquence des prévisions**, spécifiez le nombre de périodes futures pour lesquelles AutoML doit calculer les valeurs prévues. Dans la zone de gauche, saisissez le nombre entier de périodes à prévoir. Dans la zone de droite, sélectionnez les unités.

remarque

Pour utiliser Auto-ARIMA, la série temporelle doit avoir une fréquence régulière où l'intervalle entre deux points doit être le même tout au long de la série temporelle. La fréquence doit correspondre à l'unité de fréquence spécifiée dans l'appel API ou dans l'interface utilisateur d'AutoML. AutoML gère les étapes temporelles manquantes en remplissant ces valeurs avec la valeur précédente.

  1. Avec Databricks Runtime 11.3 LTS ML et versions ultérieures, vous pouvez enregistrer les résultats de prédiction. Pour ce faire, spécifiez une base de données dans le champ Base de données de sortie . Cliquez sur Parcourir et sélectionnez une base de données dans la boîte de dialogue. AutoML écrit les résultats de prédiction dans une table de cette base de données.

  2. Le champ Nom de l'expérimentation affiche le nom par default. Pour le modifier, saisissez le nouveau nom dans le champ.

Vous pouvez également :

Configurations avancées

Ouvrez la section **Configuration avancée (facultatif)** pour accéder à ces paramètres.

  • La métrique d'évaluation est la métrique principale utilisée pour noter les exécutions.

  • Dans Databricks Runtime 10.4 LTS ML et versions ultérieures, vous pouvez exclure les frameworks d'entraînement. Par default, AutoML entraîne des modèles en utilisant les frameworks listés sous algorithmes AutoML.

  • Vous pouvez modifier les conditions d'arrêt. Les conditions d'arrêt default sont :

    • Pour les expérimentations de prévision, arrêtez-vous après 120 minutes.
    • Dans Databricks Runtime 10.4 LTS ML et versions antérieures, pour les expérimentations de classification et de régression, l'arrêt se produit après 60 minutes ou après avoir terminé 200 essais, selon la première éventualité. Pour Databricks Runtime 11.0 ML et versions ultérieures, le nombre d'essais n'est pas utilisé comme condition d'arrêt.
    • Dans Databricks Runtime 10.4 LTS ML et versions ultérieures, pour les expérimentations de classification et de régression, AutoML intègre l'arrêt anticipé ; il arrête l'entraînement et l'ajustement des modèles si la métrique de validation ne s'améliore plus.
  • Dans Databricks Runtime 10.4 LTS ML et versions ultérieures, vous pouvez sélectionner un time column pour répartir les données pour l'apprentissage, la validation et les tests dans l'ordre chronologique (s'applique uniquement à la classification et à la régression).

  • Databricks recommande de laisser le champ Répertoire de données vide. Le fait de ne pas renseigner ce champ déclenche le comportement par default de stockage sécurisé du dataset en tant qu'artefact MLflow. Un chemin DBFS peut être spécifié, mais dans ce cas, le dataset n'hérite pas des autorisations d'accès de l'Experimentation AutoML.

Exécuter l'experimentation et surveiller les résultats

Pour start l’Expérimentation AutoML, cliquez sur start AutoML . L’Expérimentation start à s’exécuter, et la page d’entraînement AutoML apparaît. Pour refresh la table des exécutions, cliquez sur Bouton Refresh.

Afficher la progression de l'expérimentation

À partir de cette page, vous pouvez :

  • Arrêtez l'expérience à tout moment.
  • Ouvrir le Notebook d’exploration des données.
  • Superviser les exécutions.
  • Accédez à la page d'exécution pour toute exécution.

Avec Databricks Runtime 10.1 ML et versions ultérieures, AutoML affiche des avertissements pour les problèmes potentiels avec le dataset, tels que les types de colonnes non pris en charge ou les colonnes à forte cardinalité.

remarque

Databricks fait de son mieux pour indiquer les erreurs ou problèmes potentiels. Cependant, cela pourrait ne pas être exhaustif et pourrait ne pas couvrir les problèmes ou erreurs que vous recherchez.

Pour afficher les avertissements concernant le dataset, cliquez sur la **tab Avertissements** de la page d'entraînement ou de la page d'expérimentation une fois l'expérimentation terminée.

Avertissements AutoML

Afficher les résultats

Lorsque l'expérimentation est terminée, vous pouvez :

  • Enregistrez et déployez l'un des modèles avec MLflow.
  • Sélectionnez **Afficher le Notebook du meilleur modèle** pour examiner et modifier le Notebook qui a créé le meilleur modèle.
  • Sélectionnez **Consulter le notebook d'exploration des données** pour ouvrir le notebook d'exploration des données.
  • Recherchez, filtrez et triez les exécutions dans la table des exécutions.
  • Consultez les détails pour toute exécution :
    • Le Notebook généré contenant le code source pour un essai est accessible en cliquant sur l’exécution MLflow. Le Notebook est enregistré dans la section **Artifacts** de la page d'exécution. Vous pouvez download ce Notebook et l’importer dans le Workspace, si le download des artefacts est activé par les administrateurs de votre Workspace.
    • Pour afficher les résultats de l'exécution, cliquez dans la colonne Modèles ou la colonne Heure de start . La page d'exécution apparaît, affichant les informations sur l'exécution d'essai (telles que les parameter, les métriques et les balises) et les artefacts créés par l'exécution, y compris le modèle. Cette page comprend également des extraits de code que vous pouvez utiliser pour faire des prédictions avec le modèle.

Pour revenir ultérieurement à cette expérimentation AutoML, retrouvez-la dans le tableau de la page Expérimentations. Les résultats de chaque expérimentation AutoML, y compris l'exploration de données et les Notebooks d'entraînement, sont stockés dans un dossier databricks_automl du dossier personnel de l'utilisateur qui a exécuté l'expérimentation.

Enregistrer et déployer un modèle

Enregistrez et déployez votre modèle à l'aide de l'interface utilisateur d'AutoML. Lorsqu'une exécution se termine, la première ligne affiche le meilleur modèle basé sur la métrique principale.

  1. Sélectionnez le Link dans la colonne Modèles pour le modèle que vous souhaitez enregistrer.

  2. Sélectionnez bouton d'enregistrement du modèle pour l'enregistrer dans Unity Catalog ou dans le Model Registry.

remarque

Databricks vous recommande d'enregistrer les modèles dans Unity Catalog pour bénéficier des dernières fonctionnalités.

  1. Après l'enregistrement, vous pouvez déployer le modèle sur un endpoint de mise en service du modèle personnalisé.

Aucun module nommé 'pandas.core.indexes.numeric

Lorsque vous déployez un modèle construit à l'aide d'AutoML avec Model Serving, vous pouvez obtenir l'erreur : No module named 'pandas.core.indexes.numeric.

Ceci est dû à une version pandas incompatible entre AutoML et l'environnement de l'Endpoint de service de modèles. Vous pouvez résoudre cette erreur en exécutant le script add-pandas-dependency.py. Le script modifie les requirements.txt et conda.yaml de votre modèle enregistré afin d'inclure la version de dépendance pandas appropriée : pandas==1.5.3

  1. Modifiez le script pour inclure le run_id de l'exécution MLflow où votre modèle a été enregistré.
  2. Réenregistrez le modèle dans Unity Catalog ou le registre de modèles.
  3. Essayez de déployer la nouvelle version du modèle MLflow.

Étapes suivantes