Aller au contenu principal

Classification des données

Cette page décrit comment utiliser la classification des données Databricks dans Unity Catalog pour classifier et taguer automatiquement les données sensibles de votre catalogue.

Les data catalogs peuvent contenir une grande quantité de données, souvent des données sensibles connues et inconnues. Il est essentiel pour les équipes de données de comprendre quel type de données sensibles existe dans chaque table afin qu’elles puissent à la fois gouverner et démocratiser l’accès à ces données.

Pour résoudre ce problème, Databricks Data Classification utilise un agent d'IA pour classer et taguer automatiquement les tables de votre catalogue. Cela vous permet de découvrir des données sensibles et d'appliquer des contrôles de gouvernance sur les résultats, en utilisant des outils tels que le contrôle d'accès basé sur les attributs dans Unity Catalog. Pour une liste des tags pris en charge, veuillez consulter Tags de classification pris en charge.

À l'aide de cette fonctionnalité, vous pouvez :

  • Classer les données : Le moteur utilise un système d'IA agentique pour classer et baliser automatiquement toutes les tables dans Unity Catalog.
  • Optimiser les coûts grâce à l'analyse intelligente : le système détermine intelligemment le moment d'analyser vos données en tirant parti d'Unity Catalog et du moteur Data Intelligence. Cela signifie que l'analyse est incrémentielle et optimisée pour garantir que toutes les nouvelles données sont classifiées sans configuration manuelle.
  • Examiner et protéger les données sensibles : l'affichage des résultats vous aide à visualiser les résultats de classification et à protéger les données sensibles en balisant et en créant des politiques de contrôle d'accès pour chaque classe.

Les administrateurs de compte et de metastore peuvent surveiller la couverture de classification, comme le pourcentage de tables avec des détections de données sensibles, sur la page Données du Governance Hub.

important

La classification des données Databricks utilise le stockage par default pour enregistrer les résultats de classification. Le stockage ne vous est pas facturé.

Databricks Data Classification utilise un grand modèle de langage (LLM) pour faciliter la classification.

Exigences

  • Votre Workspace doit disposer de compute Serverless (activé par default dans les Workspaces avec Unity Catalog).
  • Pour activer la classification des données, vous devez être propriétaire du catalogue ou disposer des privilèges USE CATALOG et MANAGE sur celui-ci.
  • Pour activer le marquage automatique pour un catalogue, vous devez disposer de USE CATALOG sur le catalogue, de APPLY TAG sur le catalogue et de ASSIGN sur le tag appliqué.
  • Pour afficher les résultats de classification dans l'interface utilisateur, vous devez disposer de USE CATALOG et soit de MANAGE, soit de (SELECT + USE SCHEMA) sur le catalogue. Pour voir les exemples de valeurs associées aux détections, vous devez disposer de SELECT sur la table système des résultats.
remarque

Par default, seuls les administrateurs de compte disposent des autorisations MANAGE et ASSIGN sur les tags gouvernés du système de classification des données. Les administrateurs de compte peuvent accorder MANAGE et ASSIGN pour les tags gouvernés individuels à d'autres utilisateurs, Service Principals ou groupes. Consultez Gérer les autorisations sur les tags gouvernés.

Utiliser la classification des données

Vous pouvez activer la classification des données pour plusieurs catalogues à la fois depuis la page de résultats, ou configurer des catalogues individuels avec un contrôle plus granulaire au niveau du schéma.

Activer plusieurs catalogues

  1. Sur la page des résultats de classification des données, cliquez sur Configurer .
  2. Sélectionnez les catalogues que vous souhaitez activer, ou sélectionnez tous les catalogues disponibles dans le workspace.
  3. Cliquez sur Activer .

L'activation de tous les catalogues disponibles n'active pas automatiquement les futurs catalogues. Pour classer un nouveau catalogue, revenez à la boîte de dialogue Configurer et activez-le.

Activer un seul catalogue avec sélection de schéma

Pour choisir des schémas spécifiques au sein d'un catalogue :

  1. Accédez au catalogue et cliquez sur la Details tab.

    tab des détails de la page du catalogue dans Catalog Explorer.

  2. À côté de **Classification des données**, cliquez sur le bouton **Activer**.

  3. La boîte de dialogue Classification des données s'affiche. Par default, tous les schémas sont inclus. Pour inclure seulement certains schémas, sélectionnez-les dans le menu déroulant **Schémas à inclure**. Vous pouvez également sélectionner une **politique d'utilisation**.

    Fenêtre modale des paramètres de Classification des données.

  4. Cliquez sur Enregistrer .

Ceci crée un job en arrière-plan qui scanne de manière incrémentielle toutes les tables dans le catalogue ou les schémas sélectionnés.

Le moteur de classification s’appuie sur une analyse intelligente pour déterminer quand analyser une table. Les nouvelles tables et colonnes d’un catalogue sont généralement analysées dans les 24 heures suivant leur création.

Afficher les résultats de classification

Pour afficher les résultats de la classification, cliquez sur Afficher les résultats à côté du paramètre Data Classification .

Bouton d'affichage des résultats pour la classification des données.

Ceci ouvre l'interface utilisateur de classification des données pour le catalogue. Pour afficher les résultats de classification, un SQL Warehouse Serverless est requis.

Vous pouvez également consulter les résultats agrégés de tous les catalogues classifiés dans le métastore en utilisant le sélecteur de catalogue en haut à gauche. Choisissez Tous les catalogues dans le menu déroulant.

Pour chaque type de classification, le tableau affiche :

  • Colonnes détectées : Le nombre de colonnes où la classification a été détectée.
  • Étiquetage automatique : le statut d'étiquetage pour cette classification — Actif ou Inactif . Dans l'affichage du metastore, un statut de Partiellement actif indique que l'étiquetage est activé dans certains catalogues, mais pas dans tous.
  • Accès utilisateur (7 derniers jours) : nombre d’utilisateurs distincts qui ont accédé aux données non masquées ou masquées de cette classification au cours des 7 derniers jours. Utilisez ceci pour évaluer l’exposition des données sensibles au sein de votre organisation.

Page des résultats affichant le tableau des classes détectées.

Examiner les détections

Pour examiner les résultats d'un type de classification spécifique, cliquez sur **Examiner** dans la colonne la plus à droite. Un panneau apparaît avec deux onglets :

  • Colonnes détectées : Affiche les colonnes où la balise de classification a été détectée avec une confiance élevée, triées par la détection la plus récente en premier. Comprend également un graphique Détections au fil du temps et une liste de colonnes détectées avec des exemples de valeurs. Cliquez sur une barre du graphique pour voir les détections spécifiques pour cette date. Les exemples de valeurs n'apparaissent que si vous avez les autorisations requises pour afficher les résultats de la classification.
  • Accès utilisateur : Liste tous les utilisateurs qui ont accédé aux colonnes avec cette étiquette de classification, affichant leur e-mail et leur nom d'utilisateur, ainsi que s'ils ont un accès masqué ou non masqué. Affiche également les politiques de contrôle d'accès basé sur les attributs (ABAC) attribuées à cette balise de classification. Lors de l'affichage des résultats pour un seul catalogue, vous pouvez créer une nouvelle politique ABAC directement depuis le panneau.

Résultats affichant les colonnes avec des classifications détectées.

Si des colonnes détectées sont incorrectes, vous pouvez cliquer sur l'icône **Exclure** à droite de l'entrée. Voir Exclure les détections.

Activer l'étiquetage automatique

Si les colonnes identifiées correspondent à vos attentes, vous pouvez activer l'étiquetage automatique pour l'étiquette de classification. Lorsque l'étiquetage automatique est activé, toutes les détections existantes et futures de cette classification sont étiquetées.

Vous pouvez configurer l’étiquetage automatique à deux niveaux :

  • Niveau du métastore : Activer ou désactiver pour tous les catalogues à la fois. Vous devez être un administrateur de métastore et disposer de ASSIGN sur la balise appliquée.
  • Niveau du catalogue : Activer ou désactiver uniquement pour le catalogue actuel. Les paramètres au niveau du catalogue ont préséance sur le paramètre au niveau du métastore. Vous devez disposer de USE CATALOG et APPLY TAG sur le catalogue, et de ASSIGN sur le tag appliqué.

Au niveau du catalogue, le taggage automatique a trois états :

  • **Default (hérité)** : le catalogue hérite du paramètre de balisage du niveau du metastore.
  • Active : Le balisage est explicitement activé pour ce catalogue, indépendamment du paramètre au niveau du métastore.
  • Inactif : le tagging est explicitement désactivé pour ce catalogue, indépendamment du paramètre au niveau du métastore.

Lorsque vous désactivez le marquage, aucun futur tag n'est appliqué, mais les tags existants ne sont pas supprimés.

remarque

Lorsque vous activez l’étiquetage automatique, les tags ne sont pas remplis rétroactivement immédiatement. Elles seront renseignées lors de la prochaine analyse, qui devrait prendre effet dans les 24 heures. Les classifications ultérieures seront étiquetées immédiatement.

Exclure les détections

info

Bêta

Les exclusions de détection et leur utilisation pour améliorer la précision future de la classification sont en version bêta.

Dans le panneau d'examen, vous pouvez exclure les détections de colonnes individuelles. Exclusion d'une détection :

  • Supprime toute étiquette de classification existante de cette colonne.
  • Empêche les futures analyses de réappliquer l'étiquette à cette colonne.
  • Fournit des retours qui améliorent la précision des futurs résultats de classification.

Pour exclure une détection, cliquez sur l'icône Exclure de la colonne correspondante dans le panneau de révision. Pour réintégrer la détection, cliquez à nouveau sur l'icône.

Exclusion d’une colonne individuelle de la détection.

La table système des résultats

La classification des données crée une table système nommée system.data_classification.results pour stocker les résultats qui, par default, ne sont accessibles qu'à l'administrateur de compte. L'administrateur du compte peut partager cette table. La table n'est accessible que lorsque vous utilisez le compute serverless. Pour plus de détails sur cette table, consultez la référence de la table système de classification des données.

important

La table de résultats system.data_classification.results contient tous les résultats de classification dans l'ensemble du métastore et inclut des exemples de valeurs provenant des tables de chaque catalogue. Vous ne devriez partager cette table qu'avec les utilisateurs privilégiés pour voir les résultats de classification à l'échelle du métastore, y compris les valeurs d'échantillon.

Les utilisateurs ayant un accès SELECT à cette table peuvent également voir des exemples de valeurs associées aux détections sur la page des résultats de la classification des données.

Configurer les contrôles de gouvernance basés sur les résultats de la classification des données

Masquez les données sensibles à l'aide d'une politique ABAC.

Databricks recommande d’utiliser le contrôle d’accès basé sur les attributs dans Unity Catalog pour créer des contrôles de gouvernance basés sur les résultats de classification des données.

Pour créer une politique à partir de la page des résultats de classification des données, cliquez sur Examiner pour une étiquette de classification, ouvrez le User Access tab et cliquez sur Nouvelle politique . Le formulaire de politique est prérempli pour masquer les colonnes avec l'étiquette de classification en cours d'examen. Pour masquer les données, spécifiez toute fonction de masquage enregistrée dans Unity Catalog et cliquez sur Enregistrer .

Vous pouvez également créer une politique qui couvre plusieurs étiquettes de classification, en changeant Lorsque la colonne en remplit la condition et en fournissant plusieurs étiquettes.

Par exemple, pour créer une politique appelée "Confidentiel" qui masque tout nom, e-mail ou numéro de téléphone, définissez la condition de correspondance sur has_tag("class.name") OR has_tag("class.email_address") OR has_tag("class.phone_number").

Découverte et suppression GDPR

Ce Notebook d'exemple montre comment vous pouvez utiliser la classification des données pour contribuer à la découverte et à la suppression des données afin d'assurer la conformité au GDPR.

Découverte et suppression GDPR à l'aide du Notebook de classification des données

Comment gérer les balises incorrectes

Si une classification est incorrecte, excluez la détection du panneau de révision. Exclure une détection supprime l’étiquette, l’empêche d’être réappliquée et améliore la précision des futures analyses. Voir Exclure les détections.

Erreurs d'analyse

Si des erreurs se produisent pendant l'analyse, un bouton **Erreurs** apparaît en haut à droite du tableau des résultats.

Page de résultats avec le bouton Erreurs en haut à droite du tableau.

Cliquez sur le bouton pour afficher les tables qui n’ont pas réussi l’analyse et les messages d’erreur associés.

Erreurs d'analyse de table de classification des données.

By default, les échecs survenus pour les tables individuelles sont ignorés et relancés le jour suivant.

Affichez les dépenses de classification des données

Pour comprendre comment la classification des données est facturée, consultez la page Tarifs. Vous pouvez consulter les dépenses liées à la classification des données soit en exécutant une query, soit en consultant le tableau de bord d'utilisation.

remarque

L'analyse initiale est plus coûteuse que les analyses ultérieures sur le même catalogue, car ces analyses sont incrémentielles et entraînent généralement des coûts inférieurs.

Affichez l'utilisation de la table système system.billing.usage

Vous pouvez interroger les dépenses de classification des données depuis system.billing.usage. Les champs created_by et catalog_id peuvent être utilisés en option pour décomposer les coûts :

  • created_by: Inclure pour voir les coûts par l'utilisateur qui a déclenché l'utilisation.
  • catalog_id: Inclure pour voir les coûts par catalogue. L'ID du catalogue est affiché dans la table system.data_classification.results.

Exemple de requête pour les 30 derniers jours :

SQL
SELECT
usage_date,
identity_metadata.created_by,
usage_metadata.catalog_id,
SUM(usage_quantity) AS dbus
FROM
system.billing.usage
WHERE
usage_date >= DATE_SUB(CURRENT_DATE(), 30)
AND billing_origin_product = 'DATA_CLASSIFICATION'
GROUP BY
usage_date,
created_by,
catalog_id
ORDER BY
usage_date DESC,
created_by;

Pour calculer le coût total en dollars, joindre avec system.billing.list_prices. La requête d'exemple suivante utilise un paramètre nommé :add_on_rate comme multiplicateur sur le prix catalogue. Définissez-le sur 1 pour utiliser directement le prix catalogue, ou sur une valeur inférieure à 1 pour refléter une remise négociée (par exemple, 0.9 pour une remise de 10 %).

Exemple de query pour le coût total en dollars au cours des 30 derniers jours :

SQL
SELECT
u.usage_date,
SUM(u.usage_quantity * lp.pricing.effective_list.default) * :add_on_rate
AS `Data Classification Dollar Cost`
FROM system.billing.usage AS u
JOIN system.billing.list_prices AS lp
ON lp.sku_name = u.sku_name
WHERE
u.billing_origin_product = 'DATA_CLASSIFICATION'
AND u.usage_end_time >= lp.price_start_time
AND (lp.price_end_time IS NULL OR u.usage_end_time < lp.price_end_time)
AND u.usage_date >= DATE_ADD(CURRENT_DATE(), -30)
GROUP BY
u.usage_date
ORDER BY
u.usage_date DESC;

Affichez l'utilisation depuis le tableau de bord d'utilisation

Si vous disposez déjà d'un tableau de bord d'utilisation configuré dans votre workspace, vous pouvez l'utiliser pour filtrer l'utilisation en sélectionnant le Projet d'origine de facturation libellé 'Classification des données'. Si vous n'avez pas de tableau de bord d'utilisation configuré, vous pouvez en importer un et appliquer le même filtrage. Pour plus de détails, consultez les tableaux de bord d'utilisation.

Balises de classification prises en charge

Pour une liste complète des tags pris en charge organisés par tags globaux, tags régionaux et cadres de conformité (PII, PCI DSS, GDPR, HIPAA, GLBA, DPDPA et PIPEDA), consultez Tags de classification pris en charge.

Limitations

  • Les vues et les vues de métriques ne sont pas prises en charge. Si la vue est basée sur des tables existantes, Databricks recommande de classifier les tables sous-jacentes pour voir si elles contiennent des données sensibles.