Aller au contenu principal

Monitoring de la qualité des données

Le monitoring de la qualité des données vous aide à garantir la qualité de tous vos assets de données dans Unity Catalog. Le monitoring de la qualité des données comprend les fonctionnalités suivantes :

  • détection d'anomalies . La détection d’anomalies permet un monitoring scalable de la qualité des données en un clic. Il surveille toutes les tables d’un schéma à l’aide d’un scanning intelligent qui priorise les tables importantes et ignore celles à faible impact. Databricks évalue automatiquement la qualité des données en analysant les modèles de données historiques pour évaluer la fraîcheur et l'exhaustivité de chaque table. See détection d'anomalies.
  • profilage des données . Le profilage des données fournit des statistiques sommaires sur les données d'une table. Vous pouvez également l'utiliser pour suivre les performances des applications GenAI, des Modèles de machine learning et des Endpoint de service de modèles en monitorant les tables d'inférence qui contiennent les entrées et les prédictions des modèles. See profilage des données.

Le profilage des données était précédemment connu sous le nom de Lakehouse Monitoring.

Les administrateurs de compte et de metastore peuvent consulter l'état de la qualité des données, tel que le pourcentage de tables saines, sur la page Données dans le Hub de gouvernance.

Pourquoi utiliser la détection d'anomalies ?

Pour tirer des insights utiles de vos données, vous devez avoir confiance en leur qualité. La détection d'anomalies surveille les tables activées pour la récence et l' exhaustivité .

La fraîcheur désigne la date de la dernière mise à jour d’une table. La détection d'anomalies analyse l'historique des commits à une table et construit un modèle par table pour prédire l'heure du prochain commit. Si un commit est anormalement en retard, la table est marquée comme obsolète.

L' exhaustivité fait référence au nombre de lignes qui devraient être écrites dans la table au cours des dernières 24 heures. La détection d'anomalies analyse le nombre de lignes historiques et, sur la base de ces données, prédit une plage du nombre de lignes attendu. Si le nombre de lignes engagées au cours des dernières 24 heures est inférieur à la limite inférieure de cette plage, une table est marquée comme incomplète.

Pourquoi utiliser le profilage des données ?

Le profilage des données fournit des mesures quantitatives qui vous aident à suivre et à confirmer la qualité et la cohérence de vos données au fil du temps. Le profilage des données capture les métriques historiques de la distribution des données d'une table ou les performances du modèle correspondant, qui peuvent être utilisées pour des statistiques sommaires rapides. Vous pouvez utiliser ces métriques pour surveiller une table et envoyer des alertes en cas de modifications.

Le profilage des données vous aide à répondre à des questions telles que les suivantes :

  • À quoi ressemble l'intégrité des données, et comment évolue-t-elle au fil du temps ? Par exemple, quelle est la fraction de valeurs nulles ou égales à zéro dans les données actuelles, et a-t-elle augmenté ?
  • À quoi ressemble la distribution statistique des données et comment évolue-t-elle au fil du temps ? Par exemple, quel est le 90e centile d'une colonne numérique ? Ou, quelle est la distribution des valeurs dans une colonne catégorielle, et en quoi diffère-t-elle d'hier ?
  • Existe-t-il une drift entre les données actuelles et une ligne de base connue, ou entre des fenêtres temporelles successives des données ?
  • À quoi ressemble la distribution statistique ou le drift d'un sous-ensemble ou d'une tranche des données ?
  • Comment les entrées et les prévisions des modèles de ML évoluent-elles au fil du temps ?
  • Comment la performance du modèle évolue-t-elle au fil du temps ? La version A du modèle est-elle plus performante que la version B ?

En outre, le profilage des données vous permet de contrôler la granularité temporelle des observations et de configurer des métriques personnalisées.

Le monitoring de la qualité des données ne modifie pas les tables qu'il surveille, et n'ajoute pas de surcharge aux jobs qui remplissent ces tables.

Coût

Le monitoring de la qualité des données s'exécute sur du compute serverless et est facturé en tant que DBU serverless sous le produit de facturation DATA_QUALITY_MONITORING. Le coût dépend du nombre et de la taille des tables surveillées et de la fréquence à laquelle elles sont évaluées. Pour la détection d'anomalies, la numérisation intelligente aide à contrôler les coûts en priorisant les tables importantes et en ignorant celles à faible impact.

Pour afficher et suivre vos dépenses de monitoring de la qualité des données, consultez Afficher les dépenses de monitoring de la qualité des données.