Préparation des données pour les prévisions
Cet article décrit comment AutoML prépare les données pour la formation aux prévisions et décrit les paramètres de données configurables. Vous pouvez ajuster ces options lors de la configuration de l’expérimentation dans l’interface utilisateur d’AutoML.
Pour configurer ces paramètres à l’aide de l’ API AutoML, référez-vous à la référence de l’API Python AutoML.
Types de fonctionnalités de données pris en charge
Seuls les types de fonctionnalités listés ci-dessous sont pris en charge. Par exemple, les images ne sont pas prises en charge.
Les types de fonctionnalités suivants sont pris en charge :
- Numérique (
ByteType,ShortType,IntegerType,LongType,FloatTypeetDoubleType) - Booléen
- Chaîne (catégorielle ou texte en anglais)
- Timestamps (
TimestampType,DateType) - ArrayType[Numeric] (Databricks Runtime 10.4 LTS ML et versions ultérieures)
- DecimalType (Databricks Runtime 11.3 LTS ML et versions ultérieures)
Imputer les valeurs manquantes
Dans Databricks Runtime 10.4 LTS ML et versions ultérieures, vous pouvez spécifier comment les valeurs nulles sont imputées. Dans l'interface utilisateur, sélectionnez une méthode dans le menu déroulant de la colonne **Imputer avec** du schéma de la table. Dans l'API, utilisez le paramètre imputers. Pour plus d'informations, consultez la référence de l'API AutoML Python.
Par default, AutoML sélectionne une méthode d'imputation en fonction du type et du contenu de la colonne.
Si vous spécifiez une méthode d'imputation non-default, AutoML n'effectue pas de détection de type sémantique.
Diviser les données de prévision en ensembles d'entraînement, de validation et de test.
AutoML divise vos données en trois ensembles pour l'entraînement, la validation et les tests.
Pour les tâches de prévision, AutoML utilise la validation croisée des séries temporelles. Cette méthode étend de manière incrémentielle le dataset d'entraînement chronologiquement et effectue une validation sur les points temporels suivants. La validation croisée fournit une évaluation robuste de la performance d'un modèle sur différents segments de temps. Il garantit que le modèle de prévision est rigoureusement testé par rapport aux données futures inédites, tout en maintenant la pertinence et la précision des prédictions.
Le nombre de plis de validation croisée dépend des caractéristiques de la table d'entrée telles que le nombre de séries temporelles, la présence de covariables et la longueur de la série temporelle.
Agrégation de séries temporelles
Pour les problèmes de prévision, lorsqu'il y a plusieurs valeurs pour un timestamp dans une série temporelle, AutoML utilise la moyenne des valeurs.
Pour utiliser la somme à la place, modifiez le notebook de code source généré par les exécutions d'essai. Dans la cellule Agréger les données par… , remplacez .agg(y=(target_col, "avg")) par .agg(y=(target_col, "sum")), comme illustré :
group_cols = [time_col] + id_cols
df_aggregation = df_loaded \
.groupby(group_cols) \
.agg(y=(target_col, "sum")) \
.reset_index() \
.rename(columns={ time_col : "ds" })