Aller au contenu principal

Architecture d'entreposage des données

L'entreposage des données fait référence à la collecte et au stockage de données provenant de plusieurs sources afin qu'elles puissent être rapidement consultées pour obtenir des insights commerciaux et des rapports. Cette page contient des concepts clés pour la construction d'un data warehouse dans votre data lakehouse.

L'entreposage des données dans votre lakehouse

L'architecture lakehouse et Databricks SQL apportent les capacités d'entreposage des données dans le cloud à vos data lakes. En utilisant des structures de données, des relations et des outils de gestion familiers, vous pouvez modéliser un data warehouse hautement performant et rentable qui s'exécute directement sur votre data lake. Pour plus d'informations, consultez Qu'est-ce qu'un lakehouse ?

Architecture Lakehouse avec une couche supérieure qui inclut l'entreposage des données, le Data Engineering, le streaming de données, la Data Science et le ML

Comme avec un data warehouse traditionnel, vous modélisez les données en fonction des besoins commerciaux, puis les mettez à disposition de vos utilisateurs finaux pour l'analytique et les rapports. Contrairement à un data warehouse traditionnel, vous pouvez éviter de compartimenter vos données d'analytique commerciale ou de créer des copies redondantes qui deviennent rapidement obsolètes.

La création d'un data warehouse au sein de votre lakehouse vous permet d'intégrer toutes vos données dans un système unique et de profiter de fonctionnalités telles que Unity Catalog et Delta Lake.

Unity Catalog ajoute un modèle de gouvernance unifié afin que vous puissiez sécuriser et auditer l’accès aux données et fournir des informations de lignage sur les tables en aval. Delta Lake apporte les transactions ACID et l'évolution des schémas, entre autres outils puissants, pour maintenir vos données fiables, évolutives et de haute qualité.

Qu’est-ce que Databricks SQL ?

Databricks SQL est l'ensemble des services qui apportent des capacités et des performances d'entreposage des données à vos data lakes existants. Databricks SQL prend en charge les formats ouverts et la norme ANSI SQL. Un éditeur SQL intégré à la plateforme et des outils de tableau de bord permettent aux membres de l'équipe de collaborer avec d'autres utilisateurs Databricks directement dans le Workspace. Databricks SQL s'intègre également à une variété d'outils afin que les analystes puissent rédiger des queries et des tableaux de bord dans leurs environnements préférés sans s'adapter à une nouvelle plateforme.

Databricks SQL fournit des ressources de compute générales qui sont exécutées par rapport aux tables du lakehouse. Databricks SQL est alimenté par les entrepôts SQL, anciennement appelés endpoints SQL, offrant des ressources de compute SQL évolutives découplées du stockage.

Consultez SQL warehouses pour plus d'informations sur les valeurs par défaut et les options de SQL Warehouse.

Databricks SQL s'intègre à Unity Catalog, vous permettant de découvrir, d'auditer et de gouverner les assets de données en un seul endroit. Pour en savoir plus, consultez Qu'est-ce que Unity Catalog ?

Modélisation des données sur Databricks

Un lakehouse prend en charge une variété de styles de modélisation. L'image suivante montre comment les données sont organisées et modélisées à mesure qu'elles passent par différentes couches d'un lakehouse.

Un diagramme montrant divers modèles de données à chaque niveau de l'architecture lakehouse en médaillon.

Architecture Medallion

L'architecture en médaillon est un modèle de conception de données qui décrit une série de couches de données affinées de manière incrémentielle et qui fournit une structure de base dans le lakehouse. Les couches bronze, argent et or indiquent des niveaux croissants de qualité des données, l'or représentant la qualité la plus élevée. Pour plus d'informations, consultez Qu'est-ce que l'architecture lakehouse en médaillon ?.

Dans un lakehouse, chaque couche peut contenir une ou plusieurs tables. Le data warehouse est modélisé dans la couche Silver et alimente des data marts spécialisés dans la couche Gold.

Couche Bronze

Les données peuvent entrer dans votre lakehouse dans n'importe quel format et par n'importe quelle combinaison de transactions batch ou de streaming. La couche bronze fournit l'espace d'atterrissage pour toutes vos données brutes dans leur format d'origine. Ces données sont converties en tables Delta.

Couche Silver

La couche Silver rassemble les données de différentes sources. Pour la partie de l'entreprise qui se concentre sur les applications de Data Science et de Machine Learning, c'est ici que vous start à organiser des assets de données pertinents. Ce processus est souvent caractérisé par l'accent mis sur la vitesse et l'agilité.

La couche Silver est également l'endroit où vous pouvez intégrer soigneusement des données provenant de sources disparates pour construire un data warehouse en accord avec vos processus métier existants. Souvent, ces données suivent un modèle de troisième forme normale (3NF) ou Data Vault. La spécification de contraintes de clés primaires et étrangères permet aux utilisateurs finaux de comprendre les relations entre les tables lors de l'utilisation d'Unity Catalog. Votre data warehouse devrait servir de source unique de vérité pour vos data marts.

Le data warehouse lui-même est schema-on-write et atomique. Il est conçu pour évoluer, ce qui vous permet de modifier rapidement le data warehouse pour répondre à vos besoins actuels lorsque vos processus commerciaux changent ou évoluent.

Couche Gold

La couche Gold est la couche de présentation, qui peut contenir un ou plusieurs data marts. Fréquemment, les data marts sont des modèles dimensionnels sous la forme d'un ensemble de tables associées qui capturent une perspective métier spécifique.

La couche Gold héberge également des sandbox pour les départements et la Data Science, afin de permettre l'analytique et la Data Science en libre-service à l'échelle de l'entreprise. La mise à disposition de ces sandbox et de leurs propres clusters de compute séparés empêche les équipes métier de créer des copies de données en dehors du lakehouse.

Étapes suivantes

Pour en savoir plus sur les principes et les bonnes pratiques de mise en œuvre et d'exploitation d'un lakehouse utilisant Databricks, consultez L'architecture lakehouse.