Aller au contenu principal

Architectures de référence Databricks (download)

Les architectures de référence Databricks fournissent des conseils architecturaux couvrant les sources de données, l'ingestion, les transformations, l'interrogation et le traitement, la diffusion, l'analyse et le stockage.

Chaque architecture de référence dispose d'un PDF téléchargeable au format 11 x 17 (A3).

Bien que Databricks soit une plateforme ouverte qui s'intègre à un grand écosystème d'outils partenaires, les architectures de référence se concentrent uniquement sur les services AWS et la plateforme Databricks. Les services du fournisseur cloud présentés sont sélectionnés pour illustrer les concepts et ne sont pas exhaustifs.

Architecture de référence pour la plateforme Databricks sur AWS.

Download : Architecture de référence pour la plateforme Databricks sur AWS

L'architecture de référence AWS présente les services AWS spécifiques suivants pour l'ingestion, le stockage, la diffusion et l'analyse :

  • Amazon Redshift comme source pour Lakehouse Federation
  • Amazon AppFlow et AWS Glue pour l'ingestion par batch
  • AWS IoT Core, Amazon Kinesis et AWS DMS pour l'ingestion en streaming
  • Amazon S3 comme stockage d'objets pour les données et les assets d'IA
  • Amazon RDS et Amazon DynamoDB en tant que bases de données opérationnelles
  • Amazon QuickSight comme outil de BI
  • Amazon Bedrock est utilisé par Model Serving pour appeler des LLM externes de startups d'IA de premier plan et d'Amazon

Organisation des architectures de référence

L'architecture de référence est structurée selon les phases *Source*, *Ingestion*, *Transformation*, *Query/Processus*, *Diffusion*, *Analyse* et *Stockage* :

  • Source

    Il existe trois façons d’intégrer des données externes dans la Data Intelligence Platform :

    • ETL: la plateforme permet l’intégration avec des systèmes qui fournissent des données semi-structurées et non structurées (tels que des capteurs, des appareils IoT, des médias, des fichiers et des Logs), ainsi que des données structurées provenant de bases de données relationnelles ou d’applications métier.

    • Lakehouse Federation: Les sources SQL, telles que les bases de données relationnelles, peuvent être intégrées à Databricks et Unity Catalog sans ETL. Dans ce cas, les données du système source sont régies par Unity Catalog, et les queries sont poussées vers le système source.

    • Fédération de catalogues : Les catalogues Hive Metastore externes ou AWS Glue peuvent également être intégrés dans Unity Catalog via la fédération de catalogues, permettant à Unity Catalog de contrôler les tables stockées dans Hive Metastore ou AWS Glue.

  • Ingérer

    Ingérer des données dans Databricks via le traitement par batch ou en streaming :

    • Databricks Lakeflow Connect propose des connecteurs intégrés pour l'ingestion depuis les applications d'entreprise et les bases de données. Le pipeline d'ingestion résultant est régi par Unity Catalog et est alimenté par le compute serverless et les pipelines.
    • Les fichiers déposés dans le stockage cloud peuvent être chargés directement à l'aide de l'Auto Loader Databricks.
    • Pour l'ingestion par batch de données issues d'applications d'entreprise dans Delta Lake, la plateforme Databricks s'appuie sur des outils d'ingestion partenaires dotés d'adaptateurs spécifiques pour ces systèmes d'enregistrement.
    • Les événements de streaming peuvent être ingérés directement à partir de systèmes de streaming d'événements tels que Kafka à l'aide de Structured Streaming de Databricks. Les sources de streaming peuvent être des capteurs, des objets IoT ou des processus de capture de données de changement.
  • Stockage

  • Transformer et query/traiter

    • La plateforme Databricks utilise ses moteurs Apache Spark et Photon pour toutes les Transformations et les queries.

    • Les Pipelines sont un cadre déclaratif pour simplifier et optimiser les pipelines de traitement de données fiables, maintenables et testables.

    • Propulsée par Apache Spark et Photon, la Databricks Data Intelligence Platform prend en charge les deux types de charges de travail : les queries SQL via les SQL warehouses, et les charges de travail SQL, Python et Scala via les clusters du Workspace.

    • Pour la Data Science (modélisation ML et Gen AI), la plateforme d'IA et de Machine Learning de Databricks fournit des runtimes ML spécialisés pour l'AutoML et pour le codage de Jobs ML. Tous les workflows de Data Science et d'MLOps sont mieux pris en charge par MLflow.

  • En service

    • Pour les cas d'utilisation de l'entreposage des données (DWH) et de la BI, la plateforme Databricks offre Databricks SQL, le data warehouse alimenté par des SQL warehouses et des SQL warehouses serverless.

    • Pour le machine learning, le Service de modèle est une capacité de service de modèle évolutive, en temps réel et de niveau entreprise, hébergée dans le plan de contrôle Databricks. L'Unity AI Gateway est la solution de Databricks pour la gouvernance et le monitoring de l'accès aux modèles d'IA générative pris en charge et à leurs endpoints de service de modèle associés.

    • Bases de données opérationnelles :

      • Lakebase est une base de données de traitement transactionnel en ligne (OLTP) basée sur Postgres et entièrement intégrée à la Databricks Data Intelligence Platform. Il vous permet de créer des bases de données OLTP sur Databricks et d'intégrer les charges de travail OLTP avec Databricks.

      • Les systèmes externes, tels que les bases de données opérationnelles, peuvent être utilisés pour stocker et livrer les produits de données finaux aux applications utilisateur.

  • Collaboration :

    • Les partenaires commerciaux obtiennent un accès sécurisé aux données dont ils ont besoin grâce à OpenSharing.

    • Basé sur OpenSharing, la Databricks Marketplace est un forum ouvert pour l'échange de produits de données.

    • Les salles blanches sont des environnements sécurisés et garantissant la confidentialité où plusieurs utilisateurs peuvent travailler ensemble sur des données d’entreprise sensibles sans accès direct aux données des autres.

  • Analyse

    • Les applications d'entreprise finales se trouvent dans cette voie. Les exemples incluent des clients personnalisés tels que des applications d'IA connectées à Model Serving pour l'inférence en temps réel ou des applications qui accèdent aux données poussées de Databricks vers une base de données opérationnelle.

    • Pour les cas d'utilisation de BI, les analystes utilisent généralement des outils de BI pour accéder au data warehouse. Les développeurs SQL peuvent également utiliser l'éditeur Databricks SQL (non illustré dans le diagramme) pour les requêtes et les tableaux de bord.

    • La Data Intelligence Platform propose également des dashboards pour créer des visualisations de données et partager des insights.

  • Intégrer

    • La plateforme Databricks s’intègre aux fournisseurs d’identité standard pour la gestion des utilisateurs et le Single Sign On (SSO).

    • Les services d'IA externes, tels que OpenAI, LangGraph ou HuggingFace, peuvent être utilisés directement depuis la Databricks Intelligence Platform.

    • Les orchestrateurs externes peuvent utiliser soit la REST API complète, soit des connecteurs dédiés aux outils d’orchestration externes comme Apache Airflow.

    • Unity Catalog est utilisé pour toute la gouvernance des données et de l'IA sur la plateforme Databricks Intelligence et peut intégrer d'autres bases de données à sa gouvernance par le biais de Lakehouse Federation.

      De plus, Unity Catalog peut être intégré à d'autres catalogues d'entreprise. Veuillez contacter le fournisseur du catalogue d'entreprise pour plus de détails.

Fonctionnalités courantes pour toutes les charges de travail

En outre, la plateforme Databricks offre des capacités de gestion qui prennent en charge toutes les charges de travail :

  • Gouvernance des données et de l'IA

    Le système central de gouvernance des données et de l'IA dans la Databricks Data Intelligence Platform est Unity Catalog. Unity Catalog offre un emplacement unique pour gérer les politiques d'accès aux données qui s'appliquent à tous les workspaces et prend en charge tous les assets créés ou utilisés dans Databricks, tels que les tables, les volumes, les fonctionnalités (Magasin de fonctionnalités) et les modèles (registre de modèles). Unity Catalog peut également être utilisé pour capturer le data lineage en temps réel pour les queries exécutées sur Databricks.

    Databricks Data Quality Monitoring vous permet de surveiller la qualité des données de toutes les tables de votre compte. Il détecte les anomalies sur toutes vos tables et fournit un profilage des données complet pour chaque table.

    Pour l’observabilité, les tables système constituent un magasin analytique hébergé par Databricks des données opérationnelles de votre compte. Les tables système peuvent être utilisées pour l’observabilité historique dans l’ensemble de votre compte.

  • Moteur de data intelligence

    La Databricks Data Intelligence Platform permet à l’ensemble de votre organisation d’utiliser les données et l’IA, en combinant l’IA générative avec les avantages d’unification de Databricks pour comprendre la sémantique unique de vos données. Voir les fonctionnalités d’assistance Databricks AI.

    Genie Code est disponible dans les notebooks Databricks, l'éditeur SQL, l'éditeur de fichiers et ailleurs en tant qu'assistant d'IA contextuel pour les utilisateurs.

  • Automation & orchestration

    Lakeflow Jobs orchestrent les pipelines de traitement des données, de Machine Learning et d'analytique sur la Databricks Data Intelligence Platform. LakeFlow Pipelines vous permettent de créer des pipelines ETL fiables et maintenables avec une syntaxe déclarative. La plateforme prend également en charge les CI/CD et les MLOps

Cas d'usage de haut niveau pour la plateforme Data Intelligence sur AWS

Ingestion intégrée depuis les applications SaaS et les bases de données avec Lakeflow Connect

Ingestion avec LFC sur Databricks sur AWS.

Download : architecture de référence Lakeflow Connect pour Databricks sur AWS

Databricks Lakeflow Connect propose des connecteurs intégrés pour l'ingestion à partir d'applications d'entreprise et de bases de données. Le pipeline d'ingestion qui en résulte est régi par Unity Catalog et est alimenté par le calcul serverless et les Lakeflow pipelines.

Lakeflow Connect tire parti de lectures et écritures incrémentielles efficaces pour rendre l'ingestion de données plus rapide, évolutive et plus rentable, tout en maintenant vos données à jour pour une consommation en aval.

Ingestion par batch et ETL

Architecture de référence ETL batch sur Databricks sur AWS.

Download : architecture de référence ETL par batch pour Databricks sur AWS

Les outils d'ingestion utilisent des adaptateurs spécifiques à la source pour lire les données de la source, puis les stocker dans le stockage dans le cloud à partir duquel Auto Loader peut les lire, ou appeler directement Databricks (par exemple, avec des outils d'ingestion partenaires intégrés à la plateforme Databricks). Pour charger les données, le moteur ETL et de traitement Databricks exécute les requêtes via les Pipelines. Orchestrez des jobs individuels ou multitâches à l’aide de Lakeflow Jobs et gouvernez-les à l’aide de Unity Catalog (contrôle d’accès, audit, traçabilité, etc.). Pour fournir l’accès à des tables dorées spécifiques pour les systèmes opérationnels à faible latence, exportez les tables vers une base de données opérationnelle telle qu’une base de données RDBMS ou un magasin clé-valeur à la fin du pipeline ETL.

Streaming et capture des données modifiées (CDC)

Architecture de streaming structuré Spark sur Databricks sur AWS.

download : l'architecture de streaming structuré Spark pour Databricks sur AWS

Le moteur ETL Databricks Spark Structured Streaming pour lire à partir de files d'attente d'événements telles qu'Apache Kafka ou AWS Kinesis. Les étapes en aval suivent l'approche du cas d'utilisation par batch ci-dessus.

La capture des données modifiées (CDC) en temps réel stocke généralement les événements extraits dans une file d'attente d'événements. À partir de là, le cas d'usage suit le cas d'usage de streaming.

Si le CDC est effectué par batch, avec les enregistrements extraits d'abord stockés dans le stockage cloud, Databricks Auto Loader peut les lire, et le cas d'utilisation suit l'ETL par batch.

Machine Learning et IA (traditionnelle)

Architecture de référence de machine learning et d'IA pour Databricks sur AWS.

Download : Architecture de référence de Machine Learning et d'IA pour Databricks sur AWS

Pour le machine learning, la Databricks Data Intelligence Platform fournit des bibliothèques de machine learning et de deep learning de pointe. Il offre des fonctionnalités telles que le Magasin de fonctionnalités et le Model Registry (tous deux intégrés dans Unity Catalog), des fonctionnalités à faible code avec AutoML, et l'intégration de MLflow dans le cycle de vie de la Data Science.

Unity Catalog régit tous les assets liés à la Data Science (tables, fonctionnalités et modèles), et les data scientists peuvent utiliser Lakeflow Jobs pour orchestrer leurs Jobs.

Pour déployer des modèles de manière évolutive et de qualité professionnelle, utilisez les capacités MLOps pour publier les modèles dans le service de modèles.

Applications des agents IA (Gen AI)

Architecture de référence des applications Gen AI pour Databricks sur AWS.

Download : architecture de référence de l'application Gen AI pour Databricks sur AWS

Pour déployer des modèles de manière évolutive et adaptée aux entreprises, utilisez les capacités MLOps afin de publier les modèles dans la mise à disposition de modèles.

BI et analytique SQL

Architecture de référence BI et analytique SQL pour Databricks sur AWS.

Download : architecture de référence pour l'analytique BI et SQL sur Databricks sur AWS

Pour les cas d'utilisation de BI, les analystes métier peuvent utiliser des tableaux de bord, l'éditeur Databricks SQL ou des outils de BI tels que Tableau ou Amazon QuickSight. Dans tous les cas, le moteur est Databricks SQL (Serverless ou non-Serverless), et Unity Catalog fournit la découverte des données, l'exploration, la traçabilité et le contrôle d'accès.

Applications d'entreprise

Applications professionnelles pour Databricks sur AWS.

download : applications métier pour Databricks sur AWS

Databricks Apps permet aux développeurs de créer et de déployer des applications de données et d'IA sécurisées directement sur la plateforme Databricks, ce qui élimine le besoin d'une infrastructure distincte. Les applications sont hébergées sur la plateforme serverless Databricks et s'intègrent aux principaux services de la plateforme. Utilisez Lakebase, si l'application a besoin de données OLTP synchronisées depuis Databricks.

Fédération Lakehouse

Architecture de référence de la fédération Lakehouse pour Databricks sur AWS.

Download : architecture de référence de fédération Lakehouse pour Databricks sur AWS

Lakehouse Federation permet aux bases de données SQL externes (telles que MySQL, Postgres ou Redshift) d'être intégrées à Databricks.

Toutes les charges de travail (IA, DWH et BI) peuvent en bénéficier sans avoir besoin d'ETL les données dans le stockage d'objets au préalable. Le catalogue de sources externes est mappé dans le Unity Catalog et un contrôle d'accès précis peut être appliqué pour accéder via la plateforme Databricks.

Fédération de catalogue

Architecture de référence de fédération de catalogues pour Databricks sur AWS.

download : Architecture de référence de fédération de catalogues pour Databricks sur AWS

La fédération de catalogues permet d'intégrer à Databricks des métastores Hive externes (tels que MySQL, Postgres ou Redshift) ou Amazon Glue.

Toutes les charges de travail (IA, DWH et BI) peuvent en bénéficier sans avoir besoin d'ETL les données dans le stockage d'objets au préalable. Le catalogue de sources externes est ajouté à Unity Catalog où un contrôle d'accès précis est appliqué via la plateforme Databricks.

Partager des données avec des outils tiers

Architecture de référence de Data Sharing d'entreprise pour Databricks sur AWS.

download : Architecture de référence pour partager des données avec des outils tiers pour Databricks sur AWS

Le Data Sharing de niveau entreprise avec des tiers est fourni par OpenSharing. Il permet un accès direct aux données dans le stockage d'objets sécurisé par Unity Catalog. Cette fonctionnalité est également utilisée dans la Databricks Marketplace, un forum ouvert pour l'échange de produits de données.

Consommer des données partagées depuis Databricks

Consommer les données partagées de Databricks pour Databricks sur AWS.

Download : Consommez les données partagées de l'architecture de référence Databricks pour Databricks sur AWS

Le protocole OpenSharing Databricks-to-Databricks permet aux utilisateurs de partager des données en toute sécurité avec n'importe quel utilisateur Databricks, quel que soit le compte ou l'hôte cloud, tant que cet utilisateur a accès à un Workspace activé pour Unity Catalog.