Bonnes pratiques pour la gouvernance des données et de l'IA
Ces bonnes pratiques vous aident à gouverner de manière centralisée les assets de données et d'IA sur Databricks, organisées selon les principes architecturaux des sections suivantes.
1. Unifiez la gestion des données et de l'IA
Établir un processus de gouvernance des données et de l'IA
La gouvernance des données et de l'IA est la gestion de la disponibilité, de l'utilisabilité, de l'intégrité et de la sécurité des assets de données et d'IA d'une organisation. En renforçant la gouvernance des données et de l'IA, les organisations peuvent garantir la qualité des assets qui sont essentiels pour une analytique et une prise de décision précises, aider à identifier de nouvelles opportunités, améliorer la satisfaction des clients et, en fin de compte, augmenter les revenus. Cela aide les organisations à se conformer aux réglementations de confidentialité des données et de l'IA et à améliorer les mesures de sécurité, réduisant le risque de violations de données et de pénalités. Une gouvernance efficace des données et de l'IA élimine également les redondances et rationalise la gestion de données, ce qui permet des économies de coûts et une efficacité opérationnelle accrue.
Concevez Unity Catalog pour votre organisation
Concevez la structure de votre metastore, de votre catalogue et de votre schéma pour qu'elle s'aligne sur le modèle de gouvernance et l'architecture de données de votre organisation.
Choisir un modèle de gouvernance
- Dans le modèle de gouvernance centralisé , vos administrateurs de gouvernance sont propriétaires du metastore et peuvent prendre possession de tout objet, accorder et révoquer des autorisations. Idéal pour les organisations avec un contrôle IT central fort et des exigences de conformité strictes.
- Dans un **modèle de gouvernance distribuée (fédérée)**, le catalogue ou un ensemble de catalogues constitue le domaine de données. Le propriétaire de ce catalogue peut créer et détenir tous les assets et gérer la gouvernance dans ce domaine. Les propriétaires d'un domaine donné peuvent fonctionner indépendamment des propriétaires des autres domaines. Idéal pour les grandes organisations dotées d'unités métier autonomes.
- Dans un modèle de gouvernance hybride , combinez la gouvernance centralisée pour les données sensibles avec la gouvernance fédérée pour les données opérationnelles. Idéal pour la plupart des entreprises.
Concevoir l’architecture du métastore : déployer un métastore par région cloud pour des performances optimales. Attribuez des workspaces aux métastores en fonction des exigences régionales de résidence des données. Planifiez les déploiements multi-cloud en créant des métastores distincts pour chaque fournisseur cloud.
Concevez la structure du catalogue : choisissez un modèle de catalogue qui reflète l'organisation de vos données :
- Catalogues basés sur le domaine (recommandés) : un catalogue par domaine d'activité (par exemple,
sales,marketing,finance). - Catalogues basés sur l'environnement : catalogues séparés pour le développement, la préproduction et la production
- **Catalogues basés sur le cycle de vie des données** : Catalogues pour les données brutes, organisées et analytiques
Concevez la structure du schéma : utilisez des schémas pour organiser les produits de données au sein des catalogues. Pour l'architecture en médaillon, créez des schémas pour les couches Bronze, Silver et Gold au sein de chaque catalogue (par exemple, sales.bronze_transactions, sales.silver_transactions, sales.gold_metrics).
Pour des conseils de conception détaillés et des procédures de mise en œuvre de Unity Catalog, consultez la Phase 3 : Conception de l'architecture Unity Catalog.
La solution de gouvernance des données et de l'IA Unity Catalog est intégrée à la Databricks Data Intelligence Platform. Il prend en charge tous les modèles de gouvernance et aide à gérer de manière transparente les données structurées et non structurées, les modèles de ML, les Notebooks, les tableaux de bord et les fichiers sur n'importe quel cloud ou plateforme. Les meilleures pratiques d'Unity Catalog contribuent à mettre en œuvre la gouvernance des données et de l'IA.
Gérez les métadonnées pour tous les assets de données et d'IA en un seul endroit.
Les avantages de la gestion des métadonnées pour tous les assets en un seul endroit sont similaires à ceux de maintenir une source unique de vérité pour toutes vos données. Ceci inclut une redondance de données réduite, une intégrité des données accrue et l'élimination des malentendus dus à des définitions ou taxonomies différentes. Il est également plus facile de mettre en œuvre des politiques, normes et règles mondiales avec une source unique.
En tant que bonne pratique, exécutez Databricks dans un seul compte avec un Unity Catalog. Unity Catalog peut gérer les données et les volumes (fichiers arbitraires), ainsi que les assets d’IA tels que les fonctionnalités et les modèles d’IA. Le conteneur de niveau supérieur des objets dans le Unity Catalog est un metastore. Il stocke les assets de données (tels que les tables et les vues) et les autorisations qui régissent leur accès. Utilisez un seul métastore par région cloud et n’accédez pas aux métastores entre les régions pour éviter les problèmes de latence.
Le metastore fournit un espace de noms à trois niveaux pour structurer les données, les volumes et les assets d'IA :
Databricks recommande d'utiliser des catalogues pour assurer la ségrégation au sein de l'architecture d'information de votre organisation. Cela signifie souvent que les catalogues peuvent correspondre à la portée de l'environnement de développement logiciel, à l'équipe ou à l'unité commerciale.
Assurez la traçabilité des données et de l'IA pour améliorer la visibilité des données
Le data lineage est un outil puissant qui aide les leaders de données à obtenir une meilleure visibilité et compréhension des données au sein de leurs organisations. Le data lineage décrit la transformation et l'affinage des données, de la source à l'insight. Il comprend la capture de toutes les métadonnées et événements pertinents associés aux données tout au long de leur cycle de vie, y compris la source de l'ensemble de données, les autres ensembles de données utilisés pour le créer, qui l'a créé et quand, quelles Transformations ont été effectuées, quels autres ensembles de données l'utilisent, et de nombreux autres événements et attributs.
De plus, lorsque vous entraînez un modèle sur une table dans Unity Catalog, vous pouvez suivre la lignée du modèle jusqu'aux dataset(s) en amont sur lesquels il a été entraîné et évalué.
Le lignage peut être utilisé pour de nombreux cas d'utilisation liés aux données :
- **Conformité et préparation aux audits** : Le data lineage aide les organisations à tracer la source des tables et des champs. Ceci est important pour répondre aux exigences de nombreuses réglementations en matière de conformité, telles que le Règlement général sur la protection des données (GDPR), le California Consumer Privacy Act (CCPA), le Health Insurance Portability and Accountability Act (HIPAA), le Comité de Bâle sur le contrôle bancaire (BCBS) 239 et le Sarbanes-Oxley Act (SOX).
- Analyse d'impact/gestion du changement : les données subissent de multiples Transformations de la source à la table finale prête à l'emploi. Comprendre l'impact potentiel des changements de données sur les utilisateurs en aval devient important du point de vue de la gestion des risques. Cet impact peut être facilement déterminé à l'aide du data lineage capturé par le Unity Catalog.
- **Assurance qualité des données :** Comprendre l'origine d'un jeu de données et les Transformations qui lui ont été appliquées offre un bien meilleur contexte aux data scientists et aux analystes, leur permettant d'obtenir des insights plus pertinents et précis.
- debugging et diagnostics : en cas de résultat inattendu, le data lineage aide les équipes de données à effectuer une analyse des causes profondes en remontant l'erreur jusqu'à sa source. Cela réduit considérablement le temps de dépannage.
Unity Catalog capture le data lineage d'exécution sur les queries s'exécutant sur Databricks ainsi que le model lineage. Le Lineage est pris en charge pour toutes les langues et est capturé au niveau de la colonne. Les données de traçabilité incluent les notebooks, les Jobs et les tableaux de bord liés à la query. La traçabilité peut être visualisée en quasi temps réel dans l'Explorateur de catalogues.
Ajouter des descriptions cohérentes à vos métadonnées
Les descriptions fournissent un contexte essentiel pour les données. Ils aident les utilisateurs à comprendre l'objectif et le contenu des tables et colonnes de données. Cette clarté leur permet de découvrir, d'identifier et de filtrer plus facilement les données dont ils ont besoin, ce qui est essentiel pour une analyse de données et une prise de décision efficaces. Les descriptions peuvent inclure la sensibilité des données et des information de conformité. Cela aide les organisations à respecter les exigences légales et réglementaires en matière de confidentialité et de sécurité des données. Les descriptions doivent également inclure des informations sur la source, l'exactitude et la pertinence des données. Cela contribue à garantir l'intégrité des données et favorise une meilleure collaboration entre les équipes.
Deux fonctionnalités principales dans Unity Catalog prennent en charge la description des tables et des colonnes. Unity Catalog permet de
-
ajouter des commentaires aux tables et colonnes sous forme de commentaires.
Vous pouvez également ajouter un commentaire généré par l'IA pour toute table ou colonne de table gérée par Unity Catalog afin d'accélérer le processus. Cependant, les modèles d'IA ne sont pas toujours précis et les commentaires doivent être examinés avant d'enregistrer. Databricks recommande vivement un examen humain des commentaires générés par l'IA afin de vérifier les inexactitudes.
-
ajoutez des tags à tout élément sécurisable dans Unity Catalog. Les tags sont des attributs avec des clés et des valeurs facultatives que vous pouvez appliquer à différents objets sécurisables dans Unity Catalog. Le balisage est utile pour organiser et catégoriser différents objets sécurisables au sein d'un metastore. L'utilisation de tags facilite également la recherche et la découverte de vos actifs de données.
Permettre une découverte des données facile pour les consommateurs de données
Une découverte des données facilitée permet aux data scientists, data analysts et data engineers de découvrir et de référencer rapidement les données pertinentes et d'accélérer le délai de rentabilisation.
Databricks Catalog Explorer fournit une interface utilisateur pour l'exploration et la gestion des données, des schémas (bases de données), des tables, des permissions, des propriétaires de données, des emplacements externes et des identifiants. En outre, vous pouvez utiliser l'onglet Insights dans l'Explorateur de catalogue pour afficher les queries récentes les plus fréquentes et les utilisateurs de toute table enregistrée dans Unity Catalog.
Gouvernez les assets d'IA avec les données
La relation entre la gouvernance des données et l'intelligence artificielle (IA) est devenue essentielle au succès. La manière dont les organisations gèrent, sécurisent et utilisent les données impacte directement les résultats et les considérations des implémentations d'IA : on ne peut pas avoir d'IA sans données de qualité, et on ne peut pas avoir de données de qualité sans gouvernance des données.
La gouvernance des données et de l'IA combinées améliore les performances de l'IA en garantissant un accès fluide à des données de haute qualité et à jour, ce qui conduit à une précision améliorée et à une meilleure prise de décision. Éliminer les silos accroît l'efficacité en permettant une meilleure collaboration et en rationalisant les flux de travail, ce qui se traduit par une productivité accrue et une réduction des coûts.
Une meilleure sécurité des données est un autre avantage, car une approche unifiée de la gouvernance établit des pratiques cohérentes de traitement des données, ce qui réduit les vulnérabilités et améliore la capacité d’une organisation à protéger les informations sensibles. La conformité aux réglementations en matière de confidentialité des données est plus facile à maintenir lorsque la gouvernance des données et de l'IA est intégrée, car le traitement des données et les processus d'IA sont alignés sur les exigences réglementaires.
Dans l'ensemble, une approche de gouvernance unifiée favorise la confiance des parties prenantes et assure la transparence des processus de prise de décision de l'IA en établissant des politiques et des procédures claires pour les données et l'IA.
Dans la Databricks Data Intelligence Platform, Unity Catalog est le composant central pour gouverner à la fois les données et les assets d'IA :
-
Fonctionnalité dans Unity Catalog
Dans les Workspace compatibles avec Unity Catalog, les data scientists peuvent créer des tables de fonctionnalités dans Unity Catalog. Ces tables de fonctionnalités sont des tables Delta ou des LakeFlow Pipelines gérés par Unity Catalog.
-
Les modèles dans Unity Catalog étendent les avantages d'Unity Catalog aux modèles ML, y compris le contrôle d'accès centralisé, l'audit, la lignée et la découverte de modèles dans les Workspace. Les principales fonctionnalités des modèles dans Unity Catalog comprennent la gouvernance des modèles, la lignée chronologique des modèles, le versionnement des modèles et le déploiement des modèles via des alias.
2. Unifier la sécurité des données et de l'IA
Centraliser le contrôle d'accès pour tous les assets de données et d'IA
Centraliser le contrôle d'accès pour tous les assets de données est important car cela simplifie la sécurité et la gouvernance de vos assets de données et d'IA en offrant un lieu central pour administrer et auditer l'accès à ces assets. Cette approche aide à gérer l'accès aux objets de données et d'IA plus efficacement, garantissant que les exigences opérationnelles en matière de séparation des tâches sont respectées, ce qui est crucial pour la conformité réglementaire et la prévention des risques.
La Databricks Data Intelligence Platform fournit des méthodes de contrôle d'accès aux données qui décrivent quels groupes ou individus peuvent accéder à quelles données. Ce sont des déclarations de politique qui peuvent être extrêmement granulaires et spécifiques, jusqu'à la définition de chaque enregistrement auquel chaque individu a accès. Ou elles peuvent être très expressives et étendues, comme par exemple tous les utilisateurs financiers peuvent voir toutes les données financières.
Unity Catalog centralise les contrôles d'accès pour tous les objets sécurisables pris en charge tels que les tables, les fichiers, les modèles et bien d'autres encore. Chaque objet sécurisable dans Unity Catalog a un propriétaire. Le propriétaire d'un objet dispose de tous les privilèges sur l'objet ainsi que de la possibilité d'accorder des privilèges sur l'objet sécurisable à d'autres principaux. Unity Catalog vous permet de gérer les privilèges et de configurer le contrôle d'accès à l'aide d'instructions DDL SQL.
Le Unity Catalog utilise des filtres de lignes et des masques de colonnes pour un contrôle d'accès précis. Les filtres de lignes vous permettent d'appliquer un filtre à une table afin que les requêtes ultérieures ne renvoient que les lignes pour lesquelles le prédicat du filtre évalue à vrai. Les masques de colonne vous permettent d'appliquer une fonction de masquage à une colonne de table. La fonction de masquage est évaluée lors de l'exécution de la query, en remplaçant chaque référence à la colonne cible par les résultats de la fonction de masquage.
Pour plus d'informations, consultez Sécurité, conformité et confidentialité - Gérer l'identité et l'accès en utilisant le principe du moindre privilège.
Configurer la journalisation d'audit
La journalisation d'audit est importante, car elle fournit un compte rendu détaillé des activités du système (actions des utilisateurs, modifications des paramètres, etc.) qui pourraient affecter l'intégrité du système. Alors que les logs système standards sont conçus pour aider les développeurs à résoudre les problèmes, les logs d'audit fournissent un historique des activités à des fins de conformité et d'application d'autres politiques commerciales. Le maintien de logs d'audit robustes peut aider à identifier et à assurer la préparation face aux menaces, aux violations, à la fraude et à d'autres problèmes système.
Databricks donne accès aux logs d'audit des activités effectuées par les utilisateurs Databricks, permettant à votre organisation de surveiller les modèles d'utilisation détaillés de Databricks. Il existe deux types de Logs : les logs d'audit au niveau du Workspace avec des événements au niveau du Workspace et les logs d'audit au niveau du compte avec des événements au niveau du compte.
Vous pouvez également activer les logs d'audit détaillés. Ces logs d'audit supplémentaires sont enregistrés chaque fois qu'une query ou une commande est exécutée dans votre workspace.
Auditer les événements de la plateforme de données
La journalisation d'audit est importante car elle fournit un compte rendu détaillé des activités du système. La plateforme Data Intelligence dispose de Logs d'audit pour l'accès aux métadonnées (et donc l'accès aux données) et pour le Data Sharing :
- Unity Catalog capture un journal d’audit des actions effectuées sur le métastore. Cela permet aux administrateurs d'accéder à des détails précis sur qui a accédé à un dataset donné et quelles actions ils ont effectuées.
- Pour le partage sécurisé avec OpenSharing, Databricks fournit des logs d'audit pour surveiller les événements OpenSharing, y compris :
- Lorsqu'un utilisateur crée, modifie, met à jour ou supprime un partage ou un destinataire.
- Lorsqu'un destinataire accède à un Link d'activation et download les identifiants.
- Lorsqu'un destinataire accède à des partages ou à des données dans des tables partagées.
- Lorsqu'un identifiant de destinataire est changé ou expire.
3. Établissez des normes de qualité des données
La Databricks Data Intelligence Platform offre une gestion robuste de la qualité des données avec des contrôles de qualité intégrés, des tests, un monitoring et une application pour garantir que des données précises et utiles sont disponibles pour les charges de travail BI, analytiques et Machine Learning en aval.
Les détails de l'implémentation peuvent être consultés dans Fiabilité – Gérer la qualité des données.
Définir des normes claires de qualité des données
Il est crucial de définir des normes de qualité des données claires et exploitables, car cela garantit que les données utilisées pour l'analyse, le reporting et la prise de décision sont fiables et dignes de confiance. La documentation de ces normes aide à garantir qu'elles sont respectées. Les normes de qualité des données doivent être basées sur les besoins spécifiques de l'entreprise et doivent aborder les dimensions de la qualité des données telles que la précision, l'exhaustivité, la cohérence, la ponctualité et la fiabilité :
- Exactitude : assurez-vous que les données reflètent fidèlement les valeurs réelles.
- Exhaustivité : Toutes les données nécessaires doivent être capturées et aucune donnée critique ne doit être manquante.
- Cohérence : Les données de tous les systèmes doivent être cohérentes et ne pas contredire les autres données.
- Actualité : les données doivent être mises à jour et disponibles en temps opportun.
- Fiabilité : les données doivent être obtenues et traitées de manière à garantir leur fiabilité.
Utilisez des outils de qualité des données pour le profilage, le nettoyage, la validation et le monitoring des données
Exploitez les outils de qualité des données pour le profilage, le nettoyage, la validation et le monitoring des données. Ces outils aident à l'automatisation des processus de détection et de correction des problèmes de qualité des données, ce qui est essentiel pour étendre les initiatives de qualité des données à travers les grands datasets typiques des data lakes.
Lorsque vous utilisez des LakeFlow Pipelines, utilisez des attentes pour définir des contraintes de qualité des données sur le contenu d'un jeu de données. Les attentes vous permettent de garantir que les données arrivant dans les tables répondent aux exigences de qualité des données et de fournir des insights sur la qualité des données pour chaque mise à jour de pipeline.
Mettre en œuvre et appliquer des formats et des définitions de données standardisés
Des formats et définitions de données standardisés contribuent à une représentation cohérente des données dans tous les systèmes afin de faciliter l'intégration de données et l'analyse des données, de réduire les coûts et d'améliorer la prise de décision en renforçant la communication et la collaboration entre les équipes et les services. Il contribue également à fournir une structure pour la création et le maintien de la qualité des données.
Développez et appliquez un dictionnaire de données standard qui inclut les définitions, les formats et les valeurs acceptables pour tous les éléments de données utilisés dans l'ensemble de l'organisation.
Utilisez des conventions de nommage, des formats de date et des unités de mesure cohérents dans toutes les bases de données et applications afin d'éviter les écarts et la confusion.