Aller au contenu principal

Prévision (serverless) avec AutoML

info

Aperçu

Cette fonctionnalité est en aperçu public.

Cet article vous montre comment exécuter une expérimentation de prévision serverless en utilisant l'interface utilisateur d'entraînement de modèle Databricks.

Entraînement de modèle Databricks - la prévision simplifie la prévision des données de séries chronologiques en sélectionnant automatiquement le meilleur algorithme et les hyperparamètres, le tout en s'exécutant sur des ressources de compute entièrement managées.

Pour comprendre la différence entre la prévision Serverless et la prévision classic compute, consultez Prévision Serverless par rapport à la prévision classic compute.

Exigences

Créer une Expérimentation de prévision avec l'interface utilisateur.

Allez sur votre landing page Databricks et cliquez sur Expérimentation dans la barre latérale.

  1. Dans la tuile **Prévisions**, sélectionnez **Start training**.

  2. Sélectionnez les **données d'entraînement** dans une liste de tables Unity Catalog auxquelles vous avez accès.

    • Colonne temporelle : Sélectionnez la colonne contenant les périodes temporelles pour la série chronologique. Les colonnes doivent être de type timestamp ou date.
    • Fréquence de prévision : sélectionnez l’unité de temps qui représente la fréquence de vos données d’entrée. Par exemple, minutes, heures, jours, mois. Cela détermine la granularité de votre série temporelle.
    • Horizon de prévision : spécifiez combien d'unités de la fréquence sélectionnée sont à prévoir dans le futur. Conjointement avec la fréquence de prévision, cela définit à la fois les unités de temps et le nombre d'unités de temps à prévoir.
remarque

Pour utiliser l'algorithme Auto-ARIMA, la série temporelle doit avoir une fréquence régulière où l'intervalle entre deux points quelconques doit être le même tout au long de la série temporelle. AutoML gère les étapes temporelles manquantes en remplissant ces valeurs avec la valeur précédente.

  1. Sélectionnez une colonne cible de prédiction que le modèle doit prédire.

  2. Facultativement, spécifiez un chemin d'accès aux données de prédiction de la table Unity Catalog pour stocker les prévisions générées.

    Capture d'écran de l'interface utilisateur de prévision Serverless.

  3. Sélectionnez un emplacement et un nom Unity Catalog pour l'**enregistrement de modèle**.

  4. Définissez, si vous le souhaitez, les **options avancées** :

    • **Nom de l'Experimentation** : indiquez un nom d'expérimentation MLflow.
    • Colonnes d’identification de séries temporelles — Pour les prévisions multi-séries, sélectionnez la ou les colonnes qui identifient les séries temporelles individuelles. Databricks regroupe les données par ces colonnes en tant que séries temporelles différentes et entraîne un modèle pour chaque série indépendamment.
    • Métrique principale : choisissez la métrique principale utilisée pour évaluer et sélectionner le meilleur modèle.
    • Framework d'entraînement : Choisissez les frameworks à explorer par AutoML.
    • Colonne de répartition : sélectionnez la colonne contenant la répartition personnalisée des données. Les valeurs doivent être « train », « validate », « test »
    • Colonne de poids : Spécifiez la colonne à utiliser pour la pondération des séries temporelles. Tous les échantillons d’une série temporelle donnée doivent avoir le même poids. Le poids doit être compris entre [0, 10000].
    • **Région de vacances** : Sélectionnez la région de vacances à utiliser comme covariables dans l'entraînement du modèle.
    • Délai d'expiration : Définissez une durée maximale pour l'expérimentation AutoML.

Exécuter l'experimentation et surveiller les résultats

Pour démarrer l’expérimentation AutoML, cliquez sur Commencer la formation . Depuis la page d’entraînement de l’expérimentation, vous pouvez effectuer les opérations suivantes :

  • Arrêtez l'expérience à tout moment.
  • Superviser les exécutions.
  • Accédez à la page d'exécution pour toute exécution.

De plus, vous pouvez vérifier l'état de l'experimentation telle qu'elle passe par les étapes suivantes :

  1. Prétraitement : Validez et préparez le tableau d'entrée en imputant les valeurs manquantes et en divisant les données en ensembles d'entraînement, de validation et de test. Le traitement de la génération automatique de fonctionnalités, comme l'encodage one-hot pour les fonctionnalités catégorielles, a également lieu pendant cette étape.
  2. Ajustement : explorez différents algorithmes de prévision et ajustez les hyperparamètres.
  3. Entraînement : Entraînez et évaluez le modèle final avec les meilleures configurations sélectionnées. Enregistrer le modèle dans Unity Catalog si un chemin est spécifié.

Afficher les résultats ou utiliser le meilleur modèle

Une fois la formation terminée, les résultats de prédiction sont stockés dans la table Delta spécifiée et le meilleur modèle est enregistré dans Unity Catalog.

Depuis la page des expérimentations, vous choisissez parmi les étapes suivantes :

  • Sélectionnez Afficher les prédictions pour consulter le tableau des résultats de prévision.
  • Sélectionnez Notebook d'inférence batch pour ouvrir un Notebook généré automatiquement pour l'inférence batch utilisant le meilleur modèle.
  • Sélectionnez **Créer un endpoint de service** pour déployer le meilleur modèle vers un endpoint de Model Serving.

Prévision Serverless vs. prévision classic compute

Le tableau suivant résume les différences entre la prévision Serverless et la prévision avec le compute classique

Fonctionnalité

Prévision Serverless

Prévisions de Classic Compute

Infrastructure de compute

Databricks gère la configuration du compute et optimise automatiquement les coûts et les performances.

compute configuré par l'utilisateur

Gouvernance

Modèles et artéfacts enregistrés dans Unity Catalog

Magasin de fichiers de workspace configuré par l'utilisateur

Sélection d'algorithmes

Modèles statistiques plus l'algorithme de réseau neuronal de deep learning DeepAR

Modèles statistiques

Intégration du magasin de fonctionnalités

Non pris en charge

Pris en charge

Notebooks générés automatiquement

Notebook d'inférence batch

Code source pour tous les essais

Déploiement de modèle en un clic

Pris en charge

Non pris en charge

Fractionnements entraînement/validation/test personnalisés

Pris en charge

Non pris en charge

Pondérations personnalisées pour les séries temporelles individuelles

Pris en charge

Non pris en charge

Fonctionnalité

Prévision Serverless

Prévisions de Classic Compute

Infrastructure de compute

Databricks gère la configuration du compute et optimise automatiquement les coûts et les performances.

compute configuré par l'utilisateur

Gouvernance

Modèles et artéfacts enregistrés dans Unity Catalog

Magasin de fichiers de workspace configuré par l'utilisateur

Sélection d'algorithmes

Modèles statistiques plus l'algorithme de réseau neuronal de deep learning DeepAR

Modèles statistiques

Intégration du magasin de fonctionnalités

Non pris en charge

Pris en charge

Notebooks générés automatiquement

Notebook d'inférence batch

Code source pour tous les essais

Déploiement de modèle en un clic

Pris en charge

Non pris en charge

Fractionnements entraînement/validation/test personnalisés

Pris en charge

Non pris en charge

Pondérations personnalisées pour les séries temporelles individuelles

Pris en charge

Non pris en charge