Aller au contenu principal

Principes directeurs

Les principes directeurs sont des règles de niveau zéro qui définissent et influencent votre architecture. Pour construire une plateforme Databricks qui aide votre entreprise à réussir maintenant et à l'avenir, le consensus parmi les parties prenantes de votre organisation est essentiel.

Organiser les données et proposer des données fiables en tant que produits

La conservation des données est essentielle pour créer un data lake de grande valeur pour la BI et le ML/IA. Traitez les données comme un produit avec une définition, un schéma et un cycle de vie clairs. Assurez la cohérence sémantique et l'amélioration de la qualité des données de couche en couche afin que les utilisateurs professionnels puissent entièrement faire confiance aux données.

Organisez les données et proposez des données fiables en tant que produits.

La curation des données en établissant une architecture en couches (ou multi-saut) est une bonne pratique essentielle pour Databricks, car elle permet aux équipes de données de structurer les données selon les niveaux de qualité et de définir les rôles et les responsabilités par couche. Une approche de superposition courante est :

  • Couche d’ingestion : les données sources sont ingérées dans le lakehouse dans la première couche et doivent y être conservées. Lorsque toutes les données en aval sont créées à partir de la couche d’ingestion, il est possible de reconstruire les couches suivantes à partir de cette couche, si nécessaire.
  • Couche organisée : Le but de la deuxième couche est de contenir les données nettoyées, raffinées, filtrées et agrégées. L'objectif de cette couche est de fournir une base solide et fiable pour les analyses et les rapports pour tous les rôles et fonctions.
  • Couche finale : La troisième couche est créée en fonction des besoins métier ou des projets ; elle offre une vue différente sous forme de produits de données à d'autres unités métier ou projets, préparant les données en fonction des besoins de sécurité (par exemple, des données anonymisées) ou optimisant les performances (avec des vues pré-agrégées). Les produits de données de cette couche sont considérés comme la source de vérité pour l'entreprise.

Les pipelines de toutes les couches doivent garantir que les contraintes de qualité des données sont respectées, ce qui signifie que les données sont exactes, complètes, accessibles et cohérentes à tout moment, même lors de lectures et d'écritures concurrentes. La validation des nouvelles données a lieu au moment de l'entrée des données dans la couche organisée, et les étapes ETL suivantes visent à améliorer la qualité de ces données. La qualité des données doit s'améliorer à mesure que les données progressent à travers les couches et, en tant que tel, la confiance dans les données augmente ensuite d'un point de vue commercial.

Éliminez les silos de données et minimisez le déplacement des données

Ne créez pas de copies d’un dataset avec des processus métier qui dépendent de ces différentes copies. Les copies peuvent devenir des silos de données qui se désynchronisent, ce qui entraîne une qualité inférieure de votre data lake et, finalement, des insights obsolètes ou incorrects. De plus, pour le partage de données avec des Partenaires externes, utilisez un mécanisme de partage d’entreprise qui permet un accès direct aux données de manière sécurisée.

Éliminez les silos de données et minimisez le mouvement des données.

Pour bien distinguer une copie de données d'un silo de données : une copie de données autonome ou jetable n'est pas nuisible en soi. C'est parfois nécessaire pour stimuler l'agilité, l'expérimentation et l'innovation. Cependant, si ces copies deviennent opérationnelles avec des produits de données commerciaux en aval qui en dépendent, elles deviennent des silos de données.

Pour éviter les silos de données, les équipes de données tentent généralement de construire un mécanisme ou un pipeline de données pour maintenir toutes les copies synchronisées avec l'original. Puisque cela est peu probable de se produire de manière constante, la qualité des données se dégrade finalement. Cela peut également entraîner des coûts plus élevés et une perte significative de confiance des utilisateurs. D’autre part, plusieurs cas d’utilisation métier nécessitent le Data Sharing avec des Partenaires ou des fournisseurs.

Un aspect important est de partager de manière sécurisée et fiable la dernière version du dataset. Les copies du dataset ne sont souvent pas suffisantes, car elles peuvent rapidement se désynchroniser. Au lieu de cela, les données devraient être partagées via des outils de Data Sharing d’entreprise.

Démocratisez la création de valeur grâce au libre-service

Le meilleur data lake ne peut pas fournir une valeur suffisante si les utilisateurs ne peuvent pas accéder facilement à la plateforme ou aux données pour leurs tâches de BI et de ML/IA. Réduisez les obstacles à l'accès aux données et aux plateformes pour toutes les unités commerciales. Envisagez des processus de gestion de données allégés et offrez un accès en libre-service à la plateforme et aux données sous-jacentes.

Démocratiser la création de valeur grâce au libre-service.

Les entreprises qui ont réussi à adopter une culture data-driven prospéreront. Cela signifie que chaque unité commerciale tire ses décisions de modèles analytiques ou de l'analyse de ses propres données ou de données fournies de manière centralisée. Pour les consommateurs, les données doivent être facilement découvrables et accessibles de manière sécurisée.

Un bon concept pour les producteurs de données est « les données en tant que produit » : Les données sont offertes et maintenues par une unité commerciale ou un partenaire commercial comme un produit et consommées par d'autres parties avec un contrôle d'autorisations approprié. Au lieu de s'appuyer sur une équipe centrale et des processus de demande potentiellement lents, ces produits de données doivent être créés, offerts, découverts et consommés dans une expérience en libre-service.

Cependant, ce ne sont pas seulement les données qui comptent. La démocratisation des données exige les bons outils pour permettre à chacun de produire ou de consommer et de comprendre les données. Pour cela, vous avez besoin d'une plateforme de données et d'IA moderne qui fournit l'infrastructure et les outils nécessaires pour créer des produits de données sans dupliquer l'effort de configuration d'une autre pile d'outils.

Adopter une stratégie de gouvernance des données et de l’IA à l’échelle de l’organisation

Les données sont un asset essentiel pour toute organisation, mais vous ne pouvez pas donner à tout le monde l'accès à toutes les données. L'accès aux données doit être géré activement. Le contrôle d'accès, l'audit et la traçabilité sont essentiels pour une utilisation correcte et sécurisée des données.

Adoptez une stratégie de gouvernance des données et de l'IA à l'échelle de l'organisation.

La gouvernance des données est un vaste sujet qui couvre les dimensions suivantes :

  • Qualité des données

    La condition préalable la plus importante pour des rapports, des résultats d'analyse et des modèles corrects et significatifs est des données de haute qualité. L'assurance qualité (AQ) doit exister pour toutes les étapes du pipeline. Des exemples de la façon de mettre en œuvre cela incluent des contrats de données, le respect des SLA, le maintien de schémas stables et leur évolution de manière contrôlée.

  • data catalog

    Un autre aspect important est la découverte des données : les utilisateurs de tous les secteurs d'activité, en particulier dans un modèle en libre-service, doivent pouvoir découvrir facilement les données pertinentes. Par conséquent, un lakehouse a besoin d'un data catalog qui couvre toutes les données pertinentes pour l'entreprise. Les principaux objectifs d'un data catalog sont les suivants :

    • Assurez-vous que le même concept métier est appelé et déclaré de manière uniforme dans toute l’entreprise. Vous pouvez le considérer comme un modèle sémantique dans la couche organisée et finale.
    • Suivez le data lineage précisément afin que les utilisateurs puissent expliquer comment ces données ont acquis leur forme actuelle.
    • Maintenez des métadonnées de haute qualité, qui sont aussi importantes que les données elles-mêmes pour une utilisation appropriée des données.
  • Contrôle d'accès

    La création de valeur à partir des données dans le lakehouse s'effectuant dans tous les domaines d'activité, le lakehouse doit être construit en faisant de la sécurité une priorité absolue. Les entreprises peuvent avoir une politique d'accès aux données plus ouverte ou suivre strictement le principe du moindre privilège. Indépendamment de cela, des contrôles d'accès aux données doivent être mis en place dans chaque couche. Il est important de mettre en œuvre dès le début des régimes d'autorisations précis (contrôle d'accès au niveau des colonnes et des lignes, contrôle d'accès basé sur les rôles ou les attributs). Les entreprises peuvent start avec des règles moins strictes. Mais à mesure que la plateforme lakehouse se développe, tous les mécanismes et processus pour un régime de sécurité plus sophistiqué devraient déjà être en place. De plus, tout accès aux données dans le lakehouse doit être régi par des logs d'audit dès le départ.

Encourager les interfaces ouvertes et les formats ouverts

Les interfaces ouvertes et les formats de données sont cruciaux pour l’interopérabilité entre le lakehouse et d’autres outils. Il simplifie l'intégration avec les systèmes existants et ouvre également un écosystème de partenaires qui ont intégré leurs outils à la plateforme.

Encourager l'utilisation d'interfaces ouvertes et de formats de données ouverts.

Les interfaces ouvertes sont essentielles pour favoriser l'interopérabilité et éviter la dépendance à l'égard d'un fournisseur unique. Traditionnellement, les fournisseurs ont développé des technologies propriétaires et des interfaces fermées qui limitaient les entreprises dans la manière de stocker, de traiter et de partager les données.

S'appuyer sur des interfaces ouvertes vous aide à construire l'avenir :

  • Cela augmente la longévité et la portabilité des données afin que vous puissiez les utiliser avec plus d'applications et pour plus de cas d'utilisation.
  • Il ouvre un écosystème de partenaires qui peuvent rapidement tirer parti des interfaces ouvertes pour intégrer leurs outils dans la plateforme Databricks.

Enfin, en standardisant les formats ouverts pour les données, les coûts totaux seront considérablement réduits ; vous pouvez accéder directement aux données sur le stockage cloud sans avoir besoin de les acheminer via une plateforme propriétaire qui peut entraîner des coûts de sortie et de calcul élevés.

Conçu pour monter en charge et optimisé pour les performances et les coûts

Les données continuent inévitablement de croître et de devenir plus complexes. Pour préparer votre organisation aux besoins futurs, Databricks devrait pouvoir monter en charge. Par exemple, vous devriez pouvoir ajouter de nouvelles ressources facilement à la demande. Les coûts devraient être limités à la consommation réelle.

Concevoir des systèmes évolutifs et optimisés dans une optique de performance et de coût.

Les processus ETL standards, les rapports d'activité et les tableaux de bord ont souvent des besoins en ressources prévisibles du point de vue de la mémoire et du calcul. Cependant, les nouveaux projets, les tâches saisonnières ou les approches modernes telles que la formation de modèles (attrition, prévision, maintenance) génèrent des pics de besoin en ressources. Pour qu'une entreprise puisse effectuer toutes ces charges de travail, une plateforme évolutive pour la mémoire et le calcul est nécessaire. De nouvelles Ressources doivent être ajoutées facilement à la demande, et seule la consommation réelle devrait générer des coûts. Dès la fin de la période de pointe, les ressources peuvent être de nouveau libérées et les coûts réduits en conséquence. Souvent, cela est appelé mise à l'échelle horizontale (moins ou plus de nœuds) et mise à l'échelle verticale (nœuds plus grands ou plus petits).

La mise à l'échelle permet également aux entreprises d'améliorer les performances des query en sélectionnant des nœuds avec plus de Ressources ou des clusters avec plus de nœuds. Mais au lieu de fournir en permanence de grandes machines et des clusters, ils peuvent être provisionnés à la demande uniquement pour le temps nécessaire afin d'optimiser le rapport global performance/coût. Un autre aspect de l'optimisation concerne les ressources de stockage par rapport aux ressources de compute. Puisqu'il n'y a pas de relation claire entre le volume des données et les charges de travail utilisant ces données (par exemple, en n'utilisant que des parties des données ou en effectuant des calculs intensifs sur de petites données), il est recommandé d'opter pour une plateforme d'infrastructure qui dissocie les ressources de stockage et de compute.