Aller au contenu principal

Architectures de référence Databricks (download)

Les architectures de référence Databricks fournissent des conseils architecturaux couvrant les sources de données, l'ingestion, les transformations, l'interrogation et le traitement, la diffusion, l'analyse et le stockage.

Chaque architecture de référence dispose d'un PDF téléchargeable au format 11 x 17 (A3).

Bien que Databricks soit une plateforme ouverte qui s'intègre à un vaste écosystème d'outils partenaires, les architectures de référence se concentrent uniquement sur les services Google Cloud et la plateforme Databricks. Les services du fournisseur cloud présentés sont sélectionnés pour illustrer les concepts et ne sont pas exhaustifs.

Architecture de référence pour la plateforme Databricks sur Google Cloud.

download : Architecture de référence pour la plateforme Databricks sur Google Cloud

L'architecture de référence GCP présente les services spécifiques à GCP suivants pour l'ingestion, le stockage, la diffusion et l'analyse :

  • BigQuery en tant que système source pour Lakehouse Federation
  • Pub/Sub et Datastream pour l'ingestion en streaming
  • Cloud Data Fusion pour l'ingestion par batch.
  • Stockage cloud comme stockage d'objets pour les données et les assets d'IA
  • Cloud Big Table, Cloud SQL et Data Store en tant que bases de données opérationnelles
  • Looker en tant qu'outil de BI
  • Vertex AI peut être utilisé par Model Serving pour appeler des LLM externes

Organisation des architectures de référence

L'architecture de référence est structurée selon les phases *Source*, *Ingestion*, *Transformation*, *Query/Processus*, *Diffusion*, *Analyse* et *Stockage* :

  • Source

    Il existe trois façons d’intégrer des données externes dans la Data Intelligence Platform :

    • ETL: la plateforme permet l’intégration avec des systèmes qui fournissent des données semi-structurées et non structurées (tels que des capteurs, des appareils IoT, des médias, des fichiers et des Logs), ainsi que des données structurées provenant de bases de données relationnelles ou d’applications métier.

    • Lakehouse Federation: Les sources SQL, telles que les bases de données relationnelles, peuvent être intégrées à Databricks et Unity Catalog sans ETL. Dans ce cas, les données du système source sont régies par Unity Catalog, et les queries sont poussées vers le système source.

    • Fédération de catalogues : Les catalogues Hive Metastore peuvent également être intégrés dans Unity Catalog par le biais de la fédération de catalogues, permettant à Unity Catalog de contrôler les tables stockées dans Hive Metastore.

  • Ingérer

    Ingérer des données dans Databricks via le traitement par batch ou en streaming :

    • Databricks Lakeflow Connect propose des connecteurs intégrés pour l'ingestion depuis les applications d'entreprise et les bases de données. Le pipeline d'ingestion résultant est régi par Unity Catalog et est alimenté par le compute serverless et les pipelines.
    • Les fichiers déposés dans le stockage cloud peuvent être chargés directement à l'aide de l'Auto Loader Databricks.
    • Pour l'ingestion par batch de données issues d'applications d'entreprise dans Delta Lake, la plateforme Databricks s'appuie sur des outils d'ingestion partenaires dotés d'adaptateurs spécifiques pour ces systèmes d'enregistrement.
    • Les événements de streaming peuvent être ingérés directement à partir de systèmes de streaming d'événements tels que Kafka à l'aide de Structured Streaming de Databricks. Les sources de streaming peuvent être des capteurs, des objets IoT ou des processus de capture de données de changement.
  • Stockage

  • Transformer et query/traiter

    • La plateforme Databricks utilise ses moteurs Apache Spark et Photon pour toutes les Transformations et les queries.

    • Les Pipelines sont un cadre déclaratif pour simplifier et optimiser les pipelines de traitement de données fiables, maintenables et testables.

    • Propulsée par Apache Spark et Photon, la Databricks Data Intelligence Platform prend en charge les deux types de charges de travail : les queries SQL via les SQL warehouses, et les charges de travail SQL, Python et Scala via les clusters du Workspace.

    • Pour la Data Science (modélisation ML et IA), la plateforme IA et Machine Learning de Databricks fournit des runtimes ML spécialisés pour l'AutoML et pour le codage de jobs ML. Tous les workflows de Data Science et MLOps sont mieux pris en charge par MLflow.

  • En service

    • Pour les cas d'utilisation de l'entreposage des données (DWH) et de la BI, la plateforme Databricks offre Databricks SQL, le data warehouse alimenté par des SQL warehouses et des SQL warehouses serverless.

    • Pour le machine learning, Model Serving est une fonctionnalité de service de modèles évolutive, en temps réel et de qualité entreprise, hébergée dans le plan de contrôle Databricks. Unity AI Gateway est la Solution de Databricks pour régir et monitoring l'accès aux modèles d'IA pris en charge et à leurs Endpoint de service de modèles associés.

    • Bases de données opérationnelles : les systèmes externes, tels que les bases de données opérationnelles, peuvent être utilisés pour stocker et distribuer des produits de données finaux aux applications utilisateur.

  • Collaboration :

    • Les partenaires commerciaux obtiennent un accès sécurisé aux données dont ils ont besoin grâce à OpenSharing.

    • Basé sur OpenSharing, la Databricks Marketplace est un forum ouvert pour l'échange de produits de données.

    • Les salles blanches sont des environnements sécurisés et garantissant la confidentialité où plusieurs utilisateurs peuvent travailler ensemble sur des données d’entreprise sensibles sans accès direct aux données des autres.

  • Analyse

    • Les applications d'entreprise finales se trouvent dans cette voie. Les exemples incluent des clients personnalisés tels que des applications d'IA connectées à Model Serving pour l'inférence en temps réel ou des applications qui accèdent aux données poussées de Databricks vers une base de données opérationnelle.

    • Pour les cas d'utilisation de BI, les analystes utilisent généralement des outils de BI pour accéder au data warehouse. Les développeurs SQL peuvent également utiliser l'éditeur Databricks SQL (non illustré dans le diagramme) pour les requêtes et les tableaux de bord.

    • La Data Intelligence Platform propose également des dashboards pour créer des visualisations de données et partager des insights.

  • Intégrer

    • La plateforme Databricks s’intègre aux fournisseurs d’identité standard pour la gestion des utilisateurs et le Single Sign On (SSO).

    • Les services d'IA externes, tels que OpenAI, LangGraph ou HuggingFace, peuvent être utilisés directement depuis la Databricks Intelligence Platform.

    • Les orchestrateurs externes peuvent utiliser soit la REST API complète, soit des connecteurs dédiés aux outils d’orchestration externes comme Apache Airflow.

    • Unity Catalog est utilisé pour toute la gouvernance des données et de l'IA sur la plateforme Databricks Intelligence et peut intégrer d'autres bases de données à sa gouvernance par le biais de Lakehouse Federation.

      De plus, Unity Catalog peut être intégré à d'autres catalogues d'entreprise. Veuillez contacter le fournisseur du catalogue d'entreprise pour plus de détails.

Fonctionnalités courantes pour toutes les charges de travail

En outre, la plateforme Databricks offre des capacités de gestion qui prennent en charge toutes les charges de travail :

  • Gouvernance des données et de l'IA

    Le système central de gouvernance des données et de l'IA dans la Databricks Data Intelligence Platform est Unity Catalog. Unity Catalog offre un emplacement unique pour gérer les politiques d'accès aux données qui s'appliquent à tous les workspaces et prend en charge tous les assets créés ou utilisés dans Databricks, tels que les tables, les volumes, les fonctionnalités (Magasin de fonctionnalités) et les modèles (registre de modèles). Unity Catalog peut également être utilisé pour capturer le data lineage en temps réel pour les queries exécutées sur Databricks.

    Databricks Data Quality Monitoring vous permet de surveiller la qualité des données de toutes les tables de votre compte. Il détecte les anomalies sur toutes vos tables et fournit un profilage des données complet pour chaque table.

    Pour l’observabilité, les tables système constituent un magasin analytique hébergé par Databricks des données opérationnelles de votre compte. Les tables système peuvent être utilisées pour l’observabilité historique dans l’ensemble de votre compte.

  • Moteur de data intelligence

    La Databricks Data Intelligence Platform permet à l'ensemble de votre organisation d'utiliser les données et l'IA, combinant l'IA avec les avantages d'unification de Databricks pour comprendre la sémantique unique de vos données. Voir les fonctionnalités d'assistance de Databricks AI.

    Genie Code est disponible dans les notebooks Databricks, l'éditeur SQL, l'éditeur de fichiers et ailleurs en tant qu'assistant d'IA contextuel pour les utilisateurs.

  • Automation & orchestration

    Lakeflow Jobs orchestrent les pipelines de traitement des données, de Machine Learning et d'analytique sur la Databricks Data Intelligence Platform. LakeFlow Pipelines vous permettent de créer des pipelines ETL fiables et maintenables avec une syntaxe déclarative. La plateforme prend également en charge les CI/CD et les MLOps

Cas d'usage de haut niveau pour la plateforme Data Intelligence sur Google Cloud

Ingestion intégrée depuis les applications SaaS et les bases de données avec Lakeflow Connect

Ingestion avec LFC sur Databricks sur GCP.

Download: Architecture de référence Lakeflow Connect pour Databricks sur GCP.

Databricks Lakeflow Connect propose des connecteurs intégrés pour l'ingestion à partir d'applications d'entreprise et de bases de données. Le pipeline d'ingestion qui en résulte est régi par Unity Catalog et est alimenté par le calcul serverless et les Lakeflow pipelines.

Lakeflow Connect tire parti de lectures et écritures incrémentielles efficaces pour rendre l'ingestion de données plus rapide, évolutive et plus rentable, tout en maintenant vos données à jour pour une consommation en aval.

Ingestion par batch et ETL

Architecture de référence pour l'ETL par batch sur Databricks sur GCP.

Download : architecture de référence Batch ETL pour Databricks sur Google Cloud

Les outils d'ingestion utilisent des adaptateurs spécifiques à la source pour lire les données de la source, puis les stocker dans le stockage dans le cloud à partir duquel Auto Loader peut les lire, ou appeler directement Databricks (par exemple, avec des outils d'ingestion partenaires intégrés à la plateforme Databricks). Pour charger les données, le moteur ETL et de traitement Databricks exécute les requêtes via les Pipelines. Orchestrez des jobs individuels ou multitâches à l’aide de Lakeflow Jobs et gouvernez-les à l’aide de Unity Catalog (contrôle d’accès, audit, traçabilité, etc.). Pour fournir l’accès à des tables dorées spécifiques pour les systèmes opérationnels à faible latence, exportez les tables vers une base de données opérationnelle telle qu’une base de données RDBMS ou un magasin clé-valeur à la fin du pipeline ETL.

Streaming et capture des données modifiées (CDC)

Architecture de streaming structuré Spark pour Databricks sur Google Cloud.

Download : architecture de streaming structuré Spark pour Databricks sur Google Cloud

Le moteur ETL Databricks utilise Spark Structured Streaming pour lire les files d'événements telles que Apache Kafka ou Pub/Sub. Les étapes en aval suivent l'approche du cas d'utilisation par batch ci-dessus.

La capture des données modifiées (CDC) en temps réel stocke généralement les événements extraits dans une file d'attente d'événements. À partir de là, le cas d'usage suit le cas d'usage de streaming.

Si le CDC est effectué par batch, avec les enregistrements extraits d'abord stockés dans le stockage cloud, Databricks Auto Loader peut les lire, et le cas d'utilisation suit l'ETL par batch.

Machine Learning et IA (traditionnelle)

Architecture de référence du Machine Learning et de l'AI pour Databricks sur Google Cloud.

Download: Architecture de référence Machine Learning et IA pour Databricks sur Google Cloud

Pour le machine learning, la Databricks Data Intelligence Platform fournit des bibliothèques de machine learning et de deep learning de pointe. Il offre des fonctionnalités telles que le Magasin de fonctionnalités et le Model Registry (tous deux intégrés dans Unity Catalog), des fonctionnalités à faible code avec AutoML, et l'intégration de MLflow dans le cycle de vie de la Data Science.

Unity Catalog régit tous les assets liés à la Data Science (tables, fonctionnalités et modèles), et les data scientists peuvent utiliser Lakeflow Jobs pour orchestrer leurs Jobs.

Pour déployer des modèles de manière évolutive et de qualité professionnelle, utilisez les capacités MLOps pour publier les modèles dans le service de modèles.

Applications d'agent

Architecture de référence d'application d'IA pour Databricks sur Google Cloud.

Download : architecture de référence des applications d'IA pour Databricks sur Google Cloud

Pour les cas d'utilisation de l'IA, Databricks propose des bibliothèques de pointe et des capacités d'IA spécifiques, de Data Engineering à la création d'agents et à l'affinement des modèles existants. L'architecture ci-dessus montre un exemple d'intégration de la Recherche d'IA dans un agent.

Pour déployer des modèles de manière évolutive et adaptée aux entreprises, utilisez les capacités MLOps afin de publier les modèles dans la mise à disposition de modèles.

BI et analytique SQL

Architecture de référence pour la BI et l'analytique SQL pour Databricks sur Google Cloud.

download : architecture de référence pour l'analytique BI et SQL pour Databricks sur Google Cloud

Pour les cas d'utilisation de la BI, les analystes métier peuvent utiliser des tableaux de bord, l'éditeur Databricks SQL ou des outils de BI tels que Tableau ou Looker. Dans tous les cas, le moteur est Databricks SQL (serverless ou non-serverless), et Unity Catalog assure la découverte des données, l'exploration et le contrôle d'accès.

Applications d'entreprise

Applications métier pour Databricks pour Databricks sur Google Cloud.

Download : Applications métier pour Databricks pour Databricks sur Google Cloud

Databricks Apps permet aux développeurs de créer et de déployer des applications de données et d'IA sécurisées directement sur la plateforme Databricks, ce qui élimine le besoin d'une infrastructure distincte. Les applications sont hébergées sur la plateforme serverless Databricks et s'intègrent à des services clés de la plateforme.

Fédération Lakehouse

Architecture de référence de la fédération Lakehouse pour Databricks sur Google Cloud.

Download : architecture de référence de la fédération lakehouse pour Databricks sur Google Cloud

La Lakehouse Federation permet d’intégrer des bases de données SQL de données externes (telles que MySQL ou Postgres) avec Databricks.

Toutes les charges de travail (IA, DWH et BI) peuvent en bénéficier sans avoir besoin d'ETL les données dans le stockage d'objets au préalable. Le catalogue de sources externes est mappé dans le Unity Catalog et un contrôle d'accès précis peut être appliqué pour accéder via la plateforme Databricks.

Fédération de catalogue

Architecture de référence de fédération de catalogues pour Databricks sur Google Cloud.

download: Architecture de référence de fédération de catalogues pour Databricks sur Google Cloud

La fédération du catalogue permet d’intégrer des métastores Hive externes (tels que MySQL ou Postgres) à Databricks.

Toutes les charges de travail (IA, DWH et BI) peuvent en bénéficier sans avoir besoin d'ETL les données dans le stockage d'objets au préalable. Le catalogue de sources externes est ajouté à Unity Catalog où un contrôle d'accès précis est appliqué via la plateforme Databricks.

Partager des données avec des outils tiers

Architecture de référence Enterprise Data Sharing pour Databricks sur GCP.

Download : Partage de données avec les outils tiers architecture de référence pour Databricks sur Google Cloud

Le Data Sharing de niveau entreprise avec des tiers est fourni par OpenSharing. Il permet un accès direct aux données dans le stockage d'objets sécurisé par Unity Catalog. Cette fonctionnalité est également utilisée dans la Databricks Marketplace, un forum ouvert pour l'échange de produits de données.

Consommer des données partagées depuis Databricks

Consommez les données partagées de Databricks pour Databricks sur GCP.

Download : Consommer les données partagées de l'architecture de référence Databricks pour Databricks sur Google Cloud

Le protocole OpenSharing Databricks-to-Databricks permet aux utilisateurs de partager des données en toute sécurité avec n'importe quel utilisateur Databricks, quel que soit le compte ou l'hôte cloud, tant que cet utilisateur a accès à un Workspace activé pour Unity Catalog.