Aller au contenu principal

La portée de la plateforme Databricks

Un framework de plateforme de données et d'IA moderne

Pour discuter de la portée de la plateforme de data intelligence Databricks, il est utile de définir d'abord un cadre de base pour la plateforme de données et d'IA moderne :

Cadre d'analytique des données cloud.

Présentation de la plateforme Databricks

La Databricks Data Intelligence Platform couvre l'intégralité du framework de plateforme de données moderne. Il est construit sur l'architecture lakehouse et alimenté par un moteur d'intelligence des données qui comprend les qualités uniques de vos données. C'est une base ouverte et unifiée pour les charges de travail ETL, ML/AI et DWH/BI, et Unity Catalog est la solution de gouvernance centrale des données et de l'IA.

Profils du framework de la plateforme

Le framework couvre les principaux membres de l'équipe de données (personnes) travaillant avec les applications du framework :

  • Les data engineers fournissent aux data scientists et aux analystes métier des données précises et reproductibles pour une prise de décision rapide et des insights en temps réel. Ils implémentent des processus ETL très cohérents et fiables pour accroître la confiance des utilisateurs dans les données. Ils s'assurent que les données sont bien intégrées aux différents piliers de l'entreprise et suivent généralement les bonnes pratiques de développement logiciel.
  • Les data scientists associent l'expertise analytique et la compréhension des affaires pour convertir les données en insights stratégiques et en modèles prédictifs. Ils sont passés maîtres dans la traduction des défis commerciaux en solutions data-driven, que ce soit par le biais d'insights analytiques rétrospectifs ou de modélisation prédictive prospective. En tirant parti des techniques de modélisation des données et de Machine Learning, ils conçoivent, développent et déploient des modèles qui révèlent des modèles, des tendances et des prévisions à partir des données. Ils font office de pont, convertissant des récits de données complexes en histoires compréhensibles, veillant à ce que les parties prenantes commerciales non seulement comprennent, mais puissent également agir en fonction des recommandations data-driven, ce qui favorise une approche centrée sur les données pour la résolution de problèmes au sein d'une organisation.
  • Les ingénieurs ML (ingénieurs en machine learning) dirigent l'application pratique de la Data Science dans les produits et solutions en créant, déployant et maintenant les Modèles de machine learning. Leur objectif principal s'oriente vers l'aspect ingénierie du développement et du déploiement de modèles. Les ingénieurs ML assurent la robustesse, la fiabilité et l'évolutivité des systèmes de Machine Learning dans des environnements de production, relevant les défis liés à la qualité des données, l'infrastructure et la performance. En intégrant des modèles d'IA et de ML dans les processus métier opérationnels et les produits destinés aux utilisateurs, ils facilitent l'utilisation de la Data Science pour résoudre les défis commerciaux, garantissant que les modèles ne se contentent pas de rester au stade de la recherche, mais génèrent une valeur commerciale tangible.
  • Analystes métier et utilisateurs métier : les analystes métier fournissent aux parties prenantes et aux équipes métier des données exploitables. Ils interprètent souvent les données et créent des rapports ou d'autres documents pour la direction à l'aide d'outils de BI standard. Ils sont généralement le premier point de contact pour les utilisateurs métier non techniques et les collègues des opérations pour les questions d'analyse rapides. Les tableaux de bord et les applications métier mis à disposition sur la plateforme Databricks peuvent être utilisés directement par les utilisateurs métier.
  • Développeur d'applications crée des applications de données et d'IA sécurisées sur la plateforme de données et partage ces applications avec les utilisateurs professionnels.
  • Les partenaires commerciaux sont des parties prenantes importantes dans un monde des affaires de plus en plus interconnecté. Ils sont définis comme une entreprise ou des individus avec lesquels une entreprise entretient une relation formelle pour atteindre un objectif commun, et peuvent inclure des fournisseurs, des vendeurs, des distributeurs et d'autres partenaires tiers. Le Data Sharing est un aspect important des partenariats commerciaux, car il permet le transfert et l'échange de données pour améliorer la collaboration et la prise de décision data-driven.

Domaines de l'infrastructure de la plateforme

La plateforme se compose de plusieurs domaines :

  • Stockage : Dans le cloud, les données sont principalement stockées dans un stockage d’objets évolutif, efficace et résilient chez les fournisseurs de cloud.
  • Gouvernance : les capacités liées à la gouvernance des données, telles que le contrôle d'accès, l'audit, la gestion des métadonnées, le suivi du lignage et le monitoring pour tous les assets de données et d'IA.
  • Moteur IA : Le moteur IA fournit des capacités d’IA générative pour l’ensemble de la plateforme.
  • Ingestion et transformation : les capacités pour les charges de travail ETL.
  • **Analytique avancée, ML et IA :** toutes les capacités concernant le Machine Learning, l'IA, l'IA générative et l'analytique en streaming.
  • Data warehouse : Le domaine prenant en charge les cas d'utilisation DWH et BI.
  • Base de données opérationnelle : Capacités et services liés aux bases de données opérationnelles comme les bases de données OLTP (traitement transactionnel en ligne), les magasins clé-valeur, etc.
  • Automatisation : Gestion des workflows pour le traitement des données, le Machine Learning, les pipelines analytiques, y compris le support CI/CD et MLOps.
  • Outils ETL et Data Science : Les outils frontaux que les data engineers, les data scientists et les ML engineers utilisent principalement pour leur travail.
  • Outils de BI : Les outils front-end que les analystes BI utilisent principalement pour leur travail.
  • Applications de données et d'IA : outils qui créent et hébergent des applications qui utilisent les données gérées par la plateforme sous-jacente et exploitent ses capacités d'analytique et d'IA de manière sécurisée et conforme à la gouvernance.
  • Collaboration : Capacités de Data Sharing entre deux parties ou plus.

La portée de la Databricks Platform

La Databricks Data Intelligence Platform et ses composants peuvent être mappés au cadre de la manière suivante :

Diagramme de la portée de Databricks.

download: Portée de Databricks – Composants Databricks

Charges de travail de données sur Databricks

Plus important encore, la Databricks Data Intelligence Platform couvre toutes les charges de travail pertinentes pour le domaine des données sur une seule plateforme, avec Apache Spark/Photon comme moteur :

  • Ingérer et transformer

    Databricks propose plusieurs méthodes d'ingestion de données :

    • Databricks Lakeflow Connect propose des connecteurs intégrés pour l'ingestion depuis les applications d'entreprise et les bases de données. Le pipeline d'ingestion résultant est régi par Unity Catalog et est alimenté par un compute Serverless et LakeFlow Pipelines.
    • Auto Loader traite de manière incrémentale et automatique les fichiers qui arrivent dans le stockage cloud dans des Jobs planifiés ou continus – sans avoir besoin de gérer les informations d'état. Une fois ingérées, les données brutes doivent être transformées pour être exploitables par la BI et le ML/IA. Databricks fournit de puissantes capacités ETL pour les data engineers, les data scientists et les analystes.

    Les Lakeflow pipelines permettent d'écrire des Job ETL de manière déclarative, simplifiant l'ensemble du processus de mise en œuvre. La qualité des données peut être améliorée en définissant des attentes relatives aux données.

  • Analytique avancée, ML et IA

    La plateforme inclut un ensemble d'outils entièrement intégrés de Machine Learning et d'IA pour le Machine Learning et le deep learning traditionnels, ainsi que pour l'IA générative et les grands modèles de langage (LLM). Il couvre l'ensemble du workflow, de la préparation des données à la création de modèles de Machine Learning et de deep learning, jusqu'au Model Serving.

    Spark Structured Streaming et les LakeFlow Pipelines permettent l'analytique en temps réel.

  • data warehouse

    La Databricks Data Intelligence Platform dispose également d'une solution complète de data warehouse avec Databricks SQL, gouvernée de manière centralisée par Unity Catalog avec un contrôle d'accès précis.

    Les fonctions d'IA sont des fonctions SQL intégrées qui vous permettent d'appliquer l'IA à vos données directement depuis SQL. L'intégration de l'IA dans les jobs d'analyse donne accès à des informations auparavant inaccessibles aux analystes, et leur permet de prendre des décisions plus éclairées, de gérer les risques et de maintenir un avantage concurrentiel grâce à une innovation et une efficacité data-driven.

  • Base de données opérationnelle

    Lakebase est une base de données de traitement transactionnel en ligne (OLTP) basée sur Postgres et entièrement intégrée à la Databricks Data Intelligence Platform. Il vous permet de créer une base de données OLTP sur Databricks, et d'intégrer les charges de travail OLTP à votre Lakehouse. Lakebase permet de synchroniser les données entre les charges de travail OLTP et de traitement analytique en ligne (OLAP), et est bien intégré à la gestion des fonctionnalités, aux SQL warehouses et aux Databricks Apps.

Aperçu des domaines de fonctionnalités Databricks

Il s'agit d'une cartographie des fonctionnalités de la Databricks Data Intelligence Platform vers les autres couches du cadre, du bas vers le haut :

  • Stockage cloud

    Toutes les données du lakehouse sont stockées dans le stockage d'objets du fournisseur cloud. Databricks prend en charge trois fournisseurs cloud : AWS, Azure et GCP. Les fichiers de divers formats structurés et semi-structurés (par exemple, Parquet, CSV, JSON et Avro), ainsi que des formats non structurés (tels que des images et des documents), sont ingérés et transformés à l'aide de processus par batch ou en streaming.

    Delta Lake est le format de données recommandé pour le lakehouse (transactions de fichiers, fiabilité, cohérence, mises à jour, etc.). Il est également possible de lire les tables Delta à l'aide de clients Apache Iceberg.

    Aucun format de données propriétaire n’est utilisé dans la Databricks Data Intelligence Platform : Delta Lake et Iceberg sont open source pour éviter le verrouillage propriétaire.

  • Gouvernance des données et de l'IA

    En plus de la couche de stockage, Unity Catalog offre un large éventail de capacités de gouvernance des données et de l'IA, notamment la gestion des métadonnées dans le metastore, le contrôle d'accès, l' audit, la découverte des données et le data lineage.

    Le monitoring de la qualité des données fournit des métriques de qualité prêtes à l'emploi pour les données et les assets d'IA, et des tableaux de bord auto-générés pour visualiser ces métriques.

    Les sources SQL externes peuvent être intégrées dans le lakehouse et Unity Catalog par l'intermédiaire de Lakehouse Federation.

  • Moteur IA

    La plateforme d'intelligence des données repose sur l'architecture lakehouse et est enrichie par les fonctionnalités alimentées par l'IA de Databricks. Databricks AI associe l'IA générative aux avantages d'unification de l'architecture lakehouse pour comprendre la sémantique unique de vos données. La recherche intelligente et le Genie Code sont des exemples de services alimentés par l'IA qui simplifient l'utilisation de la plateforme pour chaque utilisateur.

  • Orchestration

    Lakeflow Jobs vous permettent d'exécuter une grande variété de charges de travail tout au long du cycle de vie complet des données et de l'IA sur n'importe quel cloud. Ils vous permettent d’orchestrer des Job ainsi que des Lakeflow Pipelines pour SQL, Spark, des notebooks, DBT, des modèles ML, et bien plus encore.

    La plateforme prend également en charge CI/CD et MLOps

  • Outils ETL et DS

    Au niveau de la couche de consommation, les data engineers et les ingénieurs ML travaillent généralement avec la plateforme à l'aide d'IDEs. Les data scientists préfèrent souvent les Notebooks et utilisent les runtimes ML et IA, ainsi que le système de workflow de machine learning MLflow pour suivre les expérimentations et gérer le cycle de vie des modèles.

  • Outils BI

    Les analystes métier utilisent généralement leur outil de BI préféré pour accéder au data warehouse Databricks. Databricks SQL peut être interrogé par différents outils d'analyse et de BI, voir BI et visualisation

    En outre, la plateforme offre des outils de query et d'analyse prêts à l'emploi :

    • Tableaux de bord AI/BI pour faire glisser et déposer des visualisations de données et partager des insights.
    • Les experts du domaine, tels que les data analysts, configurent les Genie Agents avec des datasets, des exemples de queries et des directives textuelles pour aider Genie à traduire les questions métier en queries analytiques. Après la configuration, les utilisateurs métier peuvent poser des questions et générer des visualisations pour comprendre les données opérationnelles.
    • Éditeur SQL pour les analystes SQL afin d'analyser les données.
  • Applications de données et d'IA

    Les Databricks Apps permettent aux développeurs de créer des applications de données et d'IA sécurisées sur la plateforme Databricks et de partager ces applications avec les utilisateurs.

  • Collaboration

    OpenSharing est un protocole ouvert développé par Databricks pour le partage sécurisé de données avec d'autres organisations, quelle que soit la plateforme informatique qu'elles utilisent.

    Databricks Marketplace est un forum ouvert pour l'échange de produits de données. Il tire parti d'OpenSharing pour donner aux fournisseurs de données les outils nécessaires pour partager des produits de données en toute sécurité et aux consommateurs de données la possibilité d'explorer et d'étendre leur accès aux données et Data Services dont ils ont besoin.

    Clean Rooms utilisent OpenSharing et le compute serverless pour fournir un environnement sécurisé et protégeant la confidentialité où plusieurs parties peuvent travailler ensemble sur des données d'entreprise sensibles sans accès direct aux données de chacun.