détection d'anomalies
Aperçu
Cette fonctionnalité est en aperçu public.
Cette page décrit ce qu'est la détection d'anomalies, ce qu'elle surveille et comment l'utiliser.
La détection d'anomalies utilise le stockage default pour stocker les résultats d'analyse dans la table système system.data_quality_monitoring.table_results. Aucun frais ne vous est facturé pour ce stockage.
Qu'est-ce que la détection d'anomalies ?
La détection d’anomalies vous permet de surveiller la qualité des données dans toutes les tables d’un schéma. En analysant les schémas historiques, Databricks évalue automatiquement l'exhaustivité et la récence de chaque table. Les résultats sont disponibles dans l’Explorateur de catalogues.
Exigences
- Workspace avec Unity Catalog activé.
- Le compute Serverless doit être disponible dans votre workspace (activé par default dans les Workspaces avec Unity Catalog).
- Pour activer la détection d'anomalies sur un schéma, vous devez disposer des privilèges MANAGE SCHEMA ou MANAGE CATALOG sur le schéma du catalogue.
- Pour afficher l'état de l'indicateur de santé des tables, vous avez besoin des privilèges SELECT ou BROWSE.
Comment fonctionne la détection d'anomalies ?
Databricks crée un background Job qui surveille les tables pour la fraîcheur et l’ exhaustivité .
La fraîcheur désigne la date de la dernière mise à jour d’une table. Le monitoring de la qualité des données analyse l'historique des commits à une table et construit un modèle par table pour prédire l'heure du prochain commit. Si un commit est anormalement en retard, la table est marquée comme obsolète.
L' exhaustivité fait référence au nombre de lignes qui devraient être écrites dans la table au cours des dernières 24 heures. Le monitoring de la qualité des données analyse le nombre de lignes historiques et, sur la base de ces données, prédit une plage de nombres de lignes attendus. Si le nombre de lignes engagées au cours des dernières 24 heures est inférieur à la limite inférieure de cette plage, une table est marquée comme incomplète.
Databricks utilise l'analyse intelligente pour automatiser les fréquences d'analyse des tables. L'analyse intelligente priorise les tables à fort impact déterminées par la popularité et l'utilisation en aval, et réduit la fréquence pour les tables moins critiques. Pour exclure manuellement des tables, utilisez l'API Créer un moniteur ou Mettre à jour un moniteur et spécifiez les tables exclues dans le paramètre excluded_table_full_names. Pour plus d'informations, veuillez consulter la documentation API.
La détection d'anomalies **ne** modifie **pas** les tables qu'elle surveille, et n'ajoute pas non plus de surcharge aux jobs qui alimentent ces tables.
La fraîcheur des événements, basée sur les colonnes de temps d'événement et la latence d'ingestion, n'était disponible qu'aux utilisateurs de la version bêta du monitoring de la qualité des données. Dans la version actuelle, la fraîcheur des événements n'est pas prise en charge.
Pourcentage de valeurs nulles pour la complétude
Bêta
Cette fonctionnalité est en Bêta. Les administrateurs du Workspace peuvent contrôler l'accès à cette fonctionnalité à partir de la page Previews . Consultez Gérer les aperçus Databricks.
Pourcentage de valeurs nulles ajoute des détails de qualité supplémentaires à la complétude . Le pourcentage de valeurs nulles est le pourcentage de lignes écrites dans le tableau au cours des dernières 24 heures qui devraient avoir des valeurs nulles pour une colonne donnée. Le monitoring de la qualité des données analyse la tendance historique de chaque colonne et, sur la base de ces données, prédit une plage. Si le pourcentage de valeurs nulles pour une colonne au cours des dernières 24 heures est supérieur à la limite supérieure de cette plage, une table est marquée comme incomplète.
Coût
La détection d'anomalies s'exécute sur le compute serverless et est facturée en tant que DBU serverless dans le cadre du produit de facturation DATA_QUALITY_MONITORING. Le coût augmente avec le nombre et la taille des tables surveillées dans un schéma. L'analyse intelligente aide à contrôler les coûts en hiérarchisant les tables importantes et en ignorant celles à faible impact.
Pour afficher et suivre les dépenses de détection d'anomalies, consultez Dépenses de détection d'anomalies.
Activer la détection d'anomalies sur un schéma
Pour activer la détection d'anomalies sur un schéma, accédez au schéma dans Unity Catalog.
-
Sur la page du schéma, cliquez sur l' tab Détails .

-
Cliquez sur **Activer**. Dans la boîte de dialogue **Monitoring de la qualité des données**, assurez-vous que la **détection d'anomalies** est activée, puis cliquez sur « **Enregistrer** ».
-
Une analyse est lancée. Databricks analyse automatiquement chaque table à la même fréquence qu'elle est mise à jour, offrant des insights à jour sans nécessiter de configuration manuelle pour chaque table. Pour les schémas activés avant le 24 septembre 2025, Databricks a exécuté le monitoring sur les données historiques (« backtesting ») pour le premier scan, afin de vérifier la qualité de vos tables comme si le monitoring de la qualité des données avait été activé sur votre schéma il y a deux semaines.
-
Une fois l'analyse terminée, vous pouvez consulter les résultats de la détection d'anomalies pour vos tables de la manière suivante :
- Les indicateurs de santé apparaissent dans l'explorateur de catalogues pour chaque table au sein d'un schéma. Voir Indicateurs d'intégrité.
- Sous l'onglet Détails d'un schéma avec Data Quality Monitoring activée, cliquez sur Afficher les résultats , puis consultez les résultats dans Data Quality Monitoring . Voir Afficher les résultats du monitoring de la qualité des données dans l'interface utilisateur.
- Les problèmes de qualité détectés sont enregistrés dans la table système de sortie. Voir Examiner les résultats journalisés de la détection d'anomalies.
Désactiver la détection d'anomalies
Pour désactiver la détection d'anomalies :
-
Cliquez sur l'icône en forme de crayon.

-
Dans la boîte de dialogue Contrôle qualité des données , cliquez sur le bouton bascule.
Lorsque vous désactivez la détection d'anomalies, le Job de détection d'anomalies ainsi que toutes les tables et informations de détection d'anomalies sont supprimés. Cette action ne peut pas être annulée.
3. Cliquez sur Enregistrer .
Indicateurs d'intégrité
Après avoir activé la détection d'anomalies sur un schéma, des indicateurs de santé apparaissent sur les pages de présentation du schéma et de la table dans l'Explorateur de catalogues. L'indicateur d'état de santé présente un résumé de l'état de santé des tables pour les consommateurs de données et les utilisateurs professionnels sans qu'ils aient besoin de naviguer vers l'interface utilisateur de monitoring de la qualité des données. Les utilisateurs ont besoin de la permission SELECT ou BROWSE pour visualiser le statut de l'indicateur de santé.

Le tableau suivant décrit chaque état de l'indicateur de santé :
Statut | Description |
|---|---|
Conforme | Tous les contrôles de détection d'anomalies ont réussi lors de la plus récente analyse. |
Défaillant | Une ou plusieurs vérifications ont détecté une anomalie, telle qu'un problème de fraîcheur ou d'exhaustivité. |
Formation | La détection d'anomalies construit un modèle de référence à partir de données historiques. Les tables nouvellement surveillées affichent cet état jusqu'à ce que le modèle dispose de suffisamment de données pour évaluer la qualité. |
Erreur | La détection d'anomalies a rencontré une erreur lors du monitoring de cette table. |
Exclus | La table est explicitement exclue de la détection d'anomalies. |
Non activé | La détection d’anomalies n’est pas activée sur le schéma contenant cette table. |
L'analyse intelligente peut retarder la population d'indicateurs d'état pour certaines tables jusqu'à deux semaines si la table a été ignorée lors de l'analyse initiale. L'indicateur de santé est mis à jour lors de la prochaine analyse planifiée.
Afficher les résultats du monitoring de la qualité des données dans l’interface utilisateur
Le 7 octobre 2025, Databricks a publié une nouvelle version de l'interface utilisateur de monitoring des données. Les schémas pour lesquels le monitoring de la qualité des données est activé à partir de cette date ou après utilisent automatiquement cette nouvelle interface utilisateur. Cette section décrit cette dernière version de l'interface utilisateur.
Pour des informations sur l'ancienne interface utilisateur, consultez le tableau de bord de qualité des données (hérité).
Databricks vous recommande d'activer la nouvelle version pour tous vos schémas existants.
Pour activer la nouvelle version, cliquez sur le bouton bascule Monitoring de la qualité des données pour désactiver la fonctionnalité, puis cliquez à nouveau pour la réactiver.
Une fois que vous avez activé le monitoring de la qualité des données sur un schéma, vous pouvez ouvrir la page de résultats en cliquant sur Afficher les résultats . Vous pouvez également accéder aux résultats de tous les schémas pour lesquels le monitoring est activé dans Catalog Explorer.
L'interface utilisateur des résultats contient des menus déroulants pour les catalogues et les schémas. Lorsque vous sélectionnez un catalogue, la liste déroulante des schémas est renseignée avec les schémas de ce catalogue pour lesquels le monitoring de la qualité des données est activé.
-
Si vous disposez des privilèges MANAGE ou SELECT sur le catalogue, vous pouvez afficher les incidents au niveau du catalogue. Pour afficher tous les incidents dans un catalogue, sélectionnez Tous les schémas dans le menu déroulant Schéma .

-
Pour afficher les incidents pour un schéma spécifique, vous devez également disposer des privilèges MANAGE ou SELECT sur ce schéma. La sélection d'un schéma affiche ensuite les incidents uniquement pour ce schéma.
La page de résultats affiche une section de résumé en haut, qui présente la qualité globale des données pour l'étendue sélectionnée, y compris le pourcentage de tables saines et le pourcentage de schémas/tables actuellement surveillés. Sous cette section se trouve un tableau répertoriant les incidents pour toutes les tables surveillées dans l'étendue sélectionnée. Utilisez les boutons pour afficher les tables défaillantes , saines ou en erreur .

Le tableau suivant décrit les colonnes, qui sont légèrement différentes selon que vous sélectionnez **Non intègre**, **Intègre** ou **Erreur**.
Colonne | Description |
|---|---|
Statut |
|
Première détection | Lorsque le premier incident a été détecté. S'affiche uniquement dans le tab Défaillant . |
Dernier scan | Date de la dernière analyse de la table. S'affiche uniquement dans l'onglet **Healthy tab**. |
Raison | Si la table est défaillante en raison de sa fraîcheur ou de son exhaustivité. S'affiche uniquement dans le tab Défaillant . |
Cause principale | Information sur les Jobs, pipelines ou tables en amont contribuant au problème. S'affiche uniquement dans le tab Défaillant . |
Impact | Une mesure qualitative de l'impact en aval ( Élevé , Moyen ou Faible ), basée sur le nombre de tables et de queries en aval affectées. |
Fréquence de scan | Fréquence à laquelle la table a été analysée au cours de la semaine écoulée. |
Résultats | Un Link vers la page de qualité de la table où vous pouvez consulter les tendances historiques et les visualisations expliquant pourquoi une anomalie a été détectée. |
État d'erreur | Message d'erreur. S'affiche uniquement dans l'onglet tab . |
Détails | Détails sur le message d'erreur. S'affiche uniquement dans l'onglet tab . |
Gérer les incidents de table défaillante
Depuis la tab Non sain , cliquez sur Réviser dans la colonne Résultats pour ouvrir les détails de l’incident pour la table. À partir de cette vue, deux actions sont disponibles :
- M'assigner : Revendique la propriété de l'incident pour indiquer qu'il est en cours d'investigation active. Le tableau reste dans un état Non sain . L'affectation persiste pendant 7 jours.
- Pas un problème : Marque l'incident comme un faux positif et le rejette. L'état de la table passe de non sain à sain , et la colonne Résolution de la section Incidents récemment résolus affiche Aucun problème . Le rejet persiste pendant 7 jours.

Analyse des causes racines
Pour chaque table non conforme, la détection d'anomalies identifie la source la plus probable du problème de qualité. Il analyse les relations entre les assets surveillés pour déterminer si le problème provient de la table elle-même ou d'une dépendance en amont. Cette analyse utilise le data lineage d'Unity Catalog pour comprendre les relations multiniveaux entre les assets.
Lorsque la détection d'anomalies identifie une source probable, cette source apparaît dans la colonne **Cause première** de la **tab** **Défectueux** dans l' interface utilisateur de monitoring de la qualité des données. La colonne affiche la raison la plus probable du problème, tel qu'un échec de Job ou un problème de santé de table en amont.

Les informations sur la cause première sont également disponibles dans les alertes pour la détection d'anomalies. Voir Alertes pour la détection d'anomalies.
Afficher les incidents récemment résolus
Bêta
Cette fonctionnalité est en Bêta. Les administrateurs du Workspace peuvent contrôler l'accès à cette fonctionnalité à partir de la page Previews . Consultez Gérer les aperçus Databricks.
La section Incidents récemment résolus du tableau de bord de monitoring de la qualité des données affiche les tables qui étaient auparavant défectueuses mais qui se sont rétablies d'elles-mêmes depuis. Une table apparaît dans cette section lorsque son statut passe de **défectueux** à **sain** automatiquement, sans intervention manuelle.

Le monitoring des incidents récemment auto-résolus vous aide à identifier les problèmes de qualité des données auto-réparateurs. Généralement, ces problèmes sont transitoires, tels que des retards en amont ou des fenêtres d'obsolescence, qui se résolvent après l'arrivée de nouvelles données. L'examen des incidents résolus automatiquement vous aide à distinguer les problèmes intermittents des problèmes persistants et garantit que vos tables restent saines au fil du temps.
Le tableau suivant décrit les colonnes de cette section :
Colonne | Description |
|---|---|
Schéma | Le schéma contenant la table. |
Table | Le nom de la table. |
Statut | L’état actuel de la table. Les tables de cette section sont toujours Saines . |
Résolution | Comment l'incident a été résolu. Affiche Résolu automatiquement si la table s'est rétablie d'elle-même, ou Pas un problème si un utilisateur a ignoré l'incident à l'aide de l'action Pas un problème. |
Résolu | Heure à laquelle l'état de la table est passé au statut **Sain** pour la dernière fois. |
Impact | Une mesure qualitative de l'impact en aval (**Élevé**, **Moyen** ou **Faible**), basée sur le nombre de tables et de queries en aval affectées. |
Résultats | A Link to the table quality page where you can view historical trends and visualizations for the table. |
Afficher les résultats au niveau du métastore
Pour afficher les résultats de qualité des données de l'ensemble de votre metastore, utilisez l'une des méthodes suivantes :
- Tableau de bord de monitoring de la qualité des données: un tableau de bord intégré qui résume l'état des tables dans tous les catalogues du metastore.
- Template de tableau de bord: Un template que vous importez pour créer un tableau de bord à partir de la table de résultats.
Tableau de bord du monitoring de la qualité des données
Le tableau de bord Data Quality Monitoring résume l'état des tables de votre métastore. Pour l'ouvrir, cliquez sur Catalog dans la barre latérale du workspace, puis sélectionnez
Govern > Data Quality Monitoring .
Tout utilisateur peut consulter le tableau de bord. Les résultats sont limités aux catalogues et aux tables auxquels l'utilisateur est autorisé à accéder.
Par default, le tableau de bord affiche les résultats pour **Tous les catalogues** et inclut :
- Qualité des données : le pourcentage de tables conformes dans le metastore, ainsi que le nombre total de tables conformes et non conformes.
- Tous les catalogues surveillés : une liste des catalogues surveillés, triés avec les catalogues les plus défaillants en premier. Pour chaque catalogue, la liste affiche le nombre de tables surveillées, le nombre de tables critiques non saines, le pourcentage de tables saines et le propriétaire du catalogue.
Pour limiter les résultats à un seul catalogue, sélectionnez-le dans le menu déroulant **Catalog**.

Importez un template de tableau de bord
Vous pouvez également importer un Template dans votre Workspace. Ce Template crée un tableau de bord qui vous permet d'afficher tous les résultats de qualité dans le metastore.
Pour utiliser ce Template, vous devez avoir accès à la table system.data_quality_monitoring.table_results. Par default, seuls les administrateurs de compte ont accès à cette table. Ils peuvent accorder l'accès à d'autres selon les besoins.
Pour importer et utiliser le Template :
- download the fichier Template : metastore-quality-dashboard.lvdash.JSON.
- Dans la barre latérale du workspace, cliquez sur
Tableaux de bord .
- Dans le coin supérieur droit, sélectionnez **Importer le tableau de bord à partir d'un fichier** dans le menu déroulant **Créer un tableau de bord**.
- Dans la boîte de dialogue, cliquez sur Choisir un fichier , accédez au fichier Template, puis cliquez sur Importer le tableau de bord .
Le fichier est importé et le tableau de bord apparaît.

Détails de la qualité de la table
L'interface utilisateur des **Détails de la qualité des tables** vous permet d'approfondir les tendances et de comprendre pourquoi des anomalies ont été détectées pour des tables spécifiques de votre schéma. Vous pouvez accéder à cette vue de plusieurs manières :
- À partir de l' interface utilisateur des résultats (nouvelle expérience), en cliquant sur le Link de révision dans la liste des incidents.
- Depuis le tableau de bord de monitoring (tableau de bord Lakeview hérité), en cliquant sur le nom de la table dans la tab Vue d’ensemble de la qualité.
- À partir du visualiseur de table UC , en visitant le tab Qualité sur la page de la table.
Toutes les options vous mènent à la même vue des **Détails de la qualité de la table** pour la table sélectionnée.
Étant donné une table, l'interface utilisateur affiche des récapitulatifs de chaque vérification de la qualité pour la table, avec des graphes des valeurs prédites et observées à chaque évaluation Timestamp. Les graphes affichent les résultats de la dernière 1 semaine de données.

Si la table n'a pas réussi les vérifications de qualité, l'interface utilisateur affiche également les jobs en amont qui ont été identifiés comme la cause première.

Configurer les alertes
Pour configurer une alerte Databricks SQL sur le tableau des résultats de sortie, consultez Alertes pour la détection d'anomalies.
Limitations
- La détection d'anomalies ne prend pas en charge les vues ou les tables externes.
- La détermination de la complétude ne prend pas en compte les métriques telles que la fraction de valeurs nulles, les valeurs zéro ou NaN.
Détection d'anomalies héritée
Les sections suivantes abordent deux fonctionnalités héritées : le tableau de bord de la qualité des données et la configuration de Job de détection d'anomalies. La version actuelle de la détection d'anomalies n'inclut pas ces fonctionnalités. Le tableau de bord a été remplacé par l'interface utilisateur des résultats de monitoring de la qualité des données.
Tableau de bord de la qualité des données (hérité)
Tableau de bord de qualité des données (hérité)
The data quality monitoring dashboard was available only to legacy users. In the current version, use View data quality monitoring results in the UI.
La première exécution du moniteur de qualité des données crée un tableau de bord pour résumer les résultats et les tendances dérivés de la table de logs. Le tableau de bord est automatiquement renseigné avec des insights pour le schéma scanné. Un seul tableau de bord est créé par workspace à ce chemin : /Shared/Databricks Quality Monitoring/Data Quality Monitoring.
Présentation de la qualité
Le Quality Overview tab shows a summary of the latest quality status of tables in your schema based on the most recent evaluation.
To get start, vous devez saisir la table de journalisation pour le schéma que vous souhaitez analyser afin d'alimenter le tableau de bord.
La section supérieure du tableau de bord présente un aperçu des résultats de l'analyse.

Sous le résumé se trouve un tableau répertoriant les incidents de qualité par impact. Toutes les causes profondes identifiées sont affichées dans la colonne root_cause_analysis.

Sous le tableau des incidents de qualité se trouve un tableau de tables statiques identifiées qui n'ont pas été mises à jour depuis longtemps.
Définissez les paramètres pour l'évaluation de la fraîcheur et de l'exhaustivité (hérité).
Définir les parameters pour l'évaluation de la fraîcheur et de l'exhaustivité (hérité)
Starting from July 21, 2025, configuration of the job parameters is not supported for new customers. If you need to configure the job settings, contact Databricks.
Pour modifier les paramètres qui contrôlent le Job, comme la fréquence d'exécution du Job ou le nom de la table des résultats Log, vous devez modifier les paramètres du Job sous l'onglet Tasks tab de la page du Job.

Les sections suivantes décrivent des paramètres spécifiques. Pour information sur la façon de définir les task parameters, consultez Configurer les task parameters.
Planification et notifications (hérité)
Pour personnaliser le planning du job ou pour configurer des notifications, utilisez les paramètres Schedules & Triggers sur la page des jobs. Voir Automatiser les Job avec des planifications et des Trigger.
Nom de la table de journalisation (hérité)
Pour modifier le nom de la table de journalisation, ou enregistrer la table dans un schéma différent, modifiez le paramètre de tâche du job logging_table_name et spécifiez le nom souhaité. Pour enregistrer la table de journalisation dans un schéma différent, spécifiez le nom complet à 3 niveaux.
Personnalisez les évaluations freshness et completeness (héritées)
Tous les paramètres de cette section sont facultatifs. Par default, la détection d'anomalies détermine les threshold sur la base d'une analyse de l'historique de la table.
Ces paramètres sont des champs à l'intérieur du paramètre de tâche metric_configs. Le format de metric_configs est une chaîne JSON avec les valeurs par default suivantes :
[
{
"disable_check": false,
"tables_to_skip": null,
"tables_to_scan": null,
"table_threshold_overrides": null,
"table_latency_threshold_overrides": null,
"static_table_threshold_override": null,
"event_timestamp_col_names": null,
"metric_type": "FreshnessConfig"
},
{
"disable_check": true,
"tables_to_skip": null,
"tables_to_scan": null,
"table_threshold_overrides": null,
"metric_type": "CompletenessConfig"
}
]
Les paramètres suivants peuvent être utilisés pour les évaluations freshness et completeness.
Nom du champ | Description | Exemple |
|---|---|---|
| Seules les tables spécifiées sont analysées. |
|
| Les tables spécifiées sont ignorées lors de l'analyse. |
|
| L'analyse n'est pas exécutée. Utilisez ce parameter si vous souhaitez désactiver uniquement l'analyse |
|
Les paramètres suivants s'appliquent uniquement à l'évaluation freshness :
Nom du champ | Description | Exemple |
|---|---|---|
| Liste des tables de colonnes de timestamp que votre schéma pourrait avoir. Si une table comporte l'une de ces colonnes, elle est marquée |
|
| Dictionnaire composé de noms de table et de thresholds (en secondes) qui spécifient l'intervalle maximal depuis la dernière mise à jour de la table avant de marquer une table comme |
|
| Un dictionnaire composé de noms de table et de threshold de latence (en secondes) qui spécifient l'intervalle maximal depuis le dernier Timestamp de la table avant de marquer une table comme |
|
| Durée (en secondes) avant qu'une table ne soit considérée comme une table statique (c'est-à-dire une table qui n'est plus mise à jour). |
|
Le paramètre suivant s'applique uniquement à l'évaluation completeness :
Nom du champ | Description | Exemple |
|---|---|---|
| Un dictionnaire composé de noms de tables et de threshold de volume de lignes (spécifiés sous forme d’entiers). Si le nombre de lignes ajoutées à une table au cours des dernières 24 heures est inférieur au threshold spécifié, la table est marquée |
|