Créez un profil à l'aide de l'interface Databricks
Cet article montre comment créer un profilage des données à l'aide de l'interface utilisateur Databricks. Vous pouvez également utiliser l'API.
Pour accéder à l'interface utilisateur de Databricks, procédez comme suit :
-
Dans la barre latérale gauche du workspace, cliquez sur
pour ouvrir Catalog Explorer.
-
Accédez à la table que vous souhaitez profiler.
-
Cliquez sur l'onglet tab .
-
Si la détection d'anomalies n'est pas activée pour ce schéma, cliquez sur Activer .

Si la détection d'anomalies est activée pour ce schéma, cliquez sur Configurer .

-
Dans la boîte de dialogue Data Quality Monitoring , dans le champ profilage des données , cliquez sur Configurer .

-
Dans la boîte de dialogue, sélectionnez le type de profil . Les sections suivantes décrivent les options de type de profil et les sélections supplémentaires pour chaque type.
Profilage
Dans le menu déroulant Type de profil , sélectionnez le type de profil que vous souhaitez créer. Les types de profils sont affichés dans le tableau.
Type de profil | Description |
|---|---|
Profil de série temporelle | Une table contenant des valeurs mesurées au fil du temps. Cette table inclut une colonne Timestamp. |
Profil d'instantané | Toute table gérée Delta, table externe, vue, vue matérialisée ou table de streaming. La taille de table maximale pour un profil d'instantané est de 4 To. Pour les grandes tables, utilisez plutôt les profils de séries temporelles. |
Profil d'inférence | Un tableau contenant les valeurs prédites produites par un modèle de classification ou de régression de Machine Learning. Ce tableau comprend un Timestamp, un identifiant de modèle, des entrées de modèle (caractéristiques), une colonne contenant les prédictions du modèle et des colonnes facultatives contenant des identifiants d'observation uniques et des étiquettes de vérité terrain. Il peut également contenir des métadonnées, telles que des informations démographiques, qui ne sont pas utilisées comme entrées pour le modèle, mais qui pourraient être utiles pour les enquêtes sur l'équité et les biais ou d'autres tâches. |
Si vous sélectionnez TimeSeries ou Inference, des paramètres supplémentaires sont requis et sont décrits dans les sections suivantes.
- Lorsque vous créez pour la première fois un profil de série chronologique ou d'inférence, le profil n'analyse que les données des 30 jours précédant sa création. Une fois le profil créé, toutes les nouvelles données sont traitées.
- Les moniteurs définis sur les vues matérialisées ne prennent pas en charge le traitement incrémentiel.
Pour les profils TimeSeries et Inference, il est recommandé d'activer le flux de données de modification (CDF) sur votre table. Lorsque le CDF est activé, seules les données nouvellement ajoutées sont traitées, au lieu de retraiter l'intégralité de la table à chaque refresh. Cela rend l'exécution plus efficace et réduit les coûts à mesure que vous montez en charge le profilage sur de nombreuses tables.
TimeSeries profil
Pour un profil TimeSeries, vous devez effectuer les sélections suivantes :
- Spécifiez la Granularité des métriques qui détermine comment partitionner les données dans les fenêtres temporelles.
- Spécifiez la colonne Timestamp , la colonne du tableau qui contient le timestamp. Le type de données de la colonne Timestamp doit être soit
TIMESTAMP, soit un type pouvant être converti en Timestamp à l'aide de lato_timestampfonction PySpark.
Inference profil
Pour un profil Inference, en plus des granularités et du timestamp, vous devez effectuer les sélections suivantes :
- Sélectionnez le type de problème : classification ou régression.
- Spécifiez la **colonne de prédiction**, la colonne contenant les valeurs prédites du modèle.
- Spécifiez facultativement la colonne **Label**, la colonne contenant la vérité terrain pour les prédictions du modèle.
- Spécifiez la **colonne d'ID de modèle**, la colonne contenant l'ID du modèle utilisé pour la prédiction.
Options avancées
Dans la section Options avancées , vous pouvez définir la planification, ajouter des notifications par e-mail, ajouter des indicateurs personnalisés et des expressions de découpage, et modifier la configuration de profil default.
Planifier
Pour configurer un profil à exécuter selon un calendrier, sélectionnez **Refresh on schedule** et sélectionnez la fréquence et l'heure d'exécution du profil. Si vous ne souhaitez pas que le profil s’exécute automatiquement, sélectionnez Refresh manuellement . Si vous sélectionnez Refresh manuellement , vous pouvez ensuite actualiser les métriques à partir de l'onglet Qualité .
Notifications
Pour configurer les notifications par e-mail pour un profil, saisissez l'e-mail à notifier et sélectionnez les notifications à activer. Jusqu'à 5 adresses e-mail sont prises en charge par type d'événement de notification.
Métriques
Dans la section Mesures , vous pouvez choisir de modifier les paramètres default suivants :
-
**Nom du schéma des tables métriques** : le schéma Unity Catalog où sont stockées les tables métriques créées par le profil. Cet emplacement doit être au format {catalog}.{schema}. default, cette valeur est définie sur le même emplacement de schéma que la table profilée. Vous pouvez indiquer un emplacement différent.
-
Répertoire des assets : Le chemin absolu vers un répertoire existant pour stocker les assets de profilage des données. Par default, les assets sont stockés dans le répertoire par défaut : « /Users/{user_name}/databricks_lakehouse_monitoring/{table_name} ». Si vous saisissez un emplacement différent dans ce champ, les assets sont créés sous « /{table_name} » dans le répertoire que vous spécifiez. Ce répertoire peut se trouver n'importe où dans le Workspace. Pour les profils destinés à être partagés au sein d'une organisation, vous pouvez utiliser un chemin d'accès dans le répertoire « /Shared/ ».
Ce champ ne peut pas être laissé vide.
Vous pouvez également spécifier les paramètres suivants :
- **Nom de la table de référence Unity Catalog** : Nom d'une table ou d'une vue qui contient des données de référence à des fins de comparaison.
- Expressions de découpage métrique : Les expressions de découpage vous permettent de définir des sous-ensembles de la table à profiler en plus de la table dans son ensemble. Pour créer une expression de découpage, cliquez sur Ajouter une expression et saisissez la définition de l'expression. Par exemple, l'expression
"col_2 > 10"génère deux découpages : un pourcol_2 > 10et un pourcol_2 <= 10. À titre d'autre exemple, l'expression"col_1"générera un découpage pour chaque valeur unique danscol_1. Les données sont regroupées par chaque expression indépendamment, ce qui génère un découpage distinct pour chaque prédicat et ses compléments. - Métriques personnalisées : les métriques personnalisées apparaissent dans les tables de métriques comme toute métrique intégrée. Pour configurer une métrique personnalisée, cliquez sur Ajouter une métrique personnalisée .
- Saisissez un Nom pour la métrique personnalisée.
- Sélectionnez la métrique personnalisée Type . Choisissez parmi :
Aggregate,DerivedouDrift. - Dans la liste déroulante Colonnes de saisie , sélectionnez les colonnes auxquelles appliquer la métrique.
- Dans le champ Type de sortie , sélectionnez le type de données Spark de la métrique.
- Dans le champ Définition , saisissez le code SQL qui définit la métrique personnalisée.
Modifier les paramètres de profil dans l'UI
Après avoir créé un profil, vous pouvez modifier les paramètres du profil en cliquant sur Configurer sous l’onglet tab .

Dans la section Profilage des données de la boîte de dialogue, cliquez sur Configurer .

refresh et affichez les résultats du profil dans l'interface utilisateur
Pour exécuter le profil manuellement, cliquez sur « View refresh history » . Une boîte de dialogue s'ouvre, affichant tous les profils précédents. Cliquez sur **Refresh metrics** pour Trigger une mise à jour du profil.
Pour consulter l'historique de refresh, vous devez utiliser le workspace Databricks à partir duquel le profilage des données a été activé.
Pour des informations sur les statistiques stockées dans les tables de métriques de profil, consultez Surveiller les tables de métriques. Les tables de métriques sont des tables Unity Catalog. Vous pouvez les interroger dans des notebooks ou dans l'explorateur de query SQL, et les visualiser dans l'Explorateur de Catalogue.
Contrôler l'accès aux sorties de profil
Les tables de métriques et le tableau de bord créés par un profil sont la propriété de l'utilisateur qui a créé le profil. Vous pouvez utiliser les privilèges Unity Catalog pour contrôler l'accès aux tables de métriques. Pour partager des tableaux de bord au sein d’un Workspace, cliquez sur le bouton **Partager** en haut à droite du tableau de bord.
Supprimer un profil de l'interface utilisateur
Pour supprimer un profil de l'interface utilisateur, suivez les instructions de Modifier les paramètres de profil dans l'interface utilisateur pour ouvrir la boîte de dialogue **Mettre à jour le profil**. Dans le menu déroulant **Mettre à jour**, sélectionnez **Supprimer**.
