Aller au contenu principal

Qu’est-ce que Lakeflow Connect ?

Lakeflow Connect propose des connecteurs permettant d’ingérer des données provenant de fichiers locaux, d’applications d’entreprise populaires, de bases de données, de stockages cloud, de bus de messages, etc. Cette page présente certaines des façons dont Lakeflow Connect peut améliorer les performances des processus ETL. Il couvre également les cas d’utilisation courants et la gamme d’outils d’ingestion pris en charge, allant des connecteurs entièrement managés aux frameworks entièrement personnalisables.

Connecteurs par type​

Lakeflow Connect organise les connecteurs par type de source à partir duquel vous effectuez l'ingestion. Chaque type dispose d'un ensemble de connecteurs et d'un aperçu de leur fonctionnement :

    • Connecteurs de base de données
    • Ingérez des données à partir de bases de données relationnelles telles que MySQL, PostgreSQL, Oracle et SQL Server en utilisant la capture de données modifiées (change data capture).
    • Connecteurs SaaS
    • Ingérez des données à partir d’applications SaaS d’entreprise telles que Salesforce, HubSpot, Jira et Workday.
    • Connecteurs de fichiers
    • Ingérez des fichiers structurés et non structurés à partir du stockage d'objets cloud et de services de fichiers d'entreprise tels que Google Drive et SharePoint.
    • Connecteurs de streaming
    • Ingérez en continu des données provenant de bus de messages et de sources de streaming d’événements tels qu’Apache Kafka et RabbitMQ.
    • Connecteurs basés sur la query
    • Ingérez des données depuis des bases de données en interrogeant directement la source, sans capture de données modifiées (change data capture).

Modèles de service flexibles​

Lakeflow Connect propose une large gamme de connecteurs pour les applications d'entreprise, les stockages cloud, les bases de données, les bus de messages, et plus encore. Il vous offre également la flexibilité de choisir parmi les options suivantes :

Option

Description

Un service entièrement managé

Des connecteurs prêts à l'emploi qui démocratisent l'accès aux données grâce à des interfaces utilisateur et des APIs. Cela vous permet de créer des pipelines d'ingestion tout en minimisant les coûts de maintenance à long terme.

Un pipeline personnalisé

Si vous avez besoin de plus de personnalisation, vous pouvez utiliser les LakeFlow Pipelines ou le Structured Streaming. En fin de compte, cette polyvalence permet à Lakeflow Connect de répondre aux besoins spécifiques de votre organisation.

Option

Description

Un service entièrement managé

Des connecteurs prêts à l'emploi qui démocratisent l'accès aux données grâce à des interfaces utilisateur et des APIs. Cela vous permet de créer des pipelines d'ingestion tout en minimisant les coûts de maintenance à long terme.

Un pipeline personnalisé

Si vous avez besoin de plus de personnalisation, vous pouvez utiliser les LakeFlow Pipelines ou le Structured Streaming. En fin de compte, cette polyvalence permet à Lakeflow Connect de répondre aux besoins spécifiques de votre organisation.

Unification avec les outils Databricks principaux​

Lakeflow Connect utilise les fonctionnalités principales de Databricks pour offrir une gestion de données complète. Par exemple, elle offre une gouvernance via Unity Catalog, une orchestration via Lakeflow Jobs et un monitoring holistique de vos pipelines. Cela aide votre organisation à gérer la sécurité, la qualité et les coûts des données tout en unifiant vos processus d'ingestion avec vos autres outils de data engineering. Lakeflow Connect repose sur une plateforme Data + AI ouverte, offrant une flexibilité totale pour intégrer vos outils tiers préférés. Cela garantit une solution sur mesure qui s'aligne sur votre infrastructure existante et vos futures stratégies de données.

Ingestion rapide et évolutive​

Lakeflow Connect utilise des lectures et des écritures incrémentielles pour permettre une ingestion efficace. Combiné avec des Transformations incrémentielles en aval, cela peut améliorer considérablement les performances de l'ETL.

Cas d'utilisation courants​

Les clients ingèrent des données pour résoudre les problèmes les plus complexes de leurs organisations. Exemples de cas d'utilisation comprennent les éléments suivants :

Cas d'usage

Description

Vue à 360° du client

Mesure de la performance des campagnes et notation des leads clients

Gestion de portefeuille

Maximisation du ROI avec des modèles historiques et de prévision.

Analytique consommateur

Personnalisation des expériences d'achat de vos clients

Ressources humaines centralisées

Soutenir les équipes de votre organisation

Jumeaux numériques

Améliorer l'efficacité de la fabrication

Chatbots RAG

Créer des chatbots pour aider les utilisateurs à comprendre les politiques, les produits et plus encore

Cas d'usage

Description

Vue à 360° du client

Mesure de la performance des campagnes et notation des leads clients

Gestion de portefeuille

Maximisation du ROI avec des modèles historiques et de prévision.

Analytique consommateur

Personnalisation des expériences d'achat de vos clients

Ressources humaines centralisées

Soutenir les équipes de votre organisation

Jumeaux numériques

Améliorer l'efficacité de la fabrication

Chatbots RAG

Créer des chatbots pour aider les utilisateurs à comprendre les politiques, les produits et plus encore

Couches de la pile ETL​

Certains connecteurs fonctionnent à un niveau de la pile ETL. Par exemple, Databricks propose des connecteurs entièrement managés pour des applications d’entreprise telles que Salesforce et des bases de données telles que SQL Server. D’autres connecteurs fonctionnent à un autre niveau de la pile ETL. Par exemple, vous pouvez utiliser les API SQL et Spark APIs dans les pipelines LakeFlow Pipelines pour obtenir davantage d’options de personnalisation. De même, vous pouvez choisir votre niveau de personnalisation pour le streaming de données provenant d’Apache Kafka, d’Amazon Kinesis, de Google Pub/Sub et d’Apache Pulsar.

Databricks recommande de commencer par la couche la plus gérée. Si cela ne répond pas à vos exigences (par exemple, si cela ne prend pas en charge votre source de données), passez à la couche suivante.

Le tableau suivant décrit les couches des produits d’ingestion :

Couche

Description

LakeFlow Pipelines

Les LakeFlow Pipelines offrent un cadre déclaratif pour la création de pipelines de données. Définissez vos Transformations, et LakeFlow Pipelines gèrent l'orchestration, le monitoring, la qualité des données, les erreurs, et bien plus encore. Ils s'appuient sur Structured Streaming pour le streaming et prennent en charge la plupart des fonctionnalités de Structured Streaming. Pour toute fonctionnalité de Structured Streaming non encore disponible dans les Lakeflow pipelines, vous pouvez utiliser directement les APIs de Structured Streaming.

Connecteurs entièrement managés

Les connecteurs entièrement managés s'appuient sur les Lakeflow Pipelines, offrant encore plus d'automatisation pour les sources de données les plus populaires. Ils étendent la fonctionnalité des LakeFlow Pipelines pour inclure également l'authentification spécifique à la source, la CDC, la gestion des cas extrêmes, la maintenance à long terme des API, les nouvelles tentatives automatisées, l'évolution des schémas automatisée, et ainsi de suite. Par conséquent, ils offrent encore plus d'automatisation pour toutes les sources de données prises en charge.

Couche

Description

LakeFlow Pipelines

Les LakeFlow Pipelines offrent un cadre déclaratif pour la création de pipelines de données. Définissez vos Transformations, et LakeFlow Pipelines gèrent l'orchestration, le monitoring, la qualité des données, les erreurs, et bien plus encore. Ils s'appuient sur Structured Streaming pour le streaming et prennent en charge la plupart des fonctionnalités de Structured Streaming. Pour toute fonctionnalité de Structured Streaming non encore disponible dans les Lakeflow pipelines, vous pouvez utiliser directement les APIs de Structured Streaming.

Connecteurs entièrement managés

Les connecteurs entièrement managés s'appuient sur les Lakeflow Pipelines, offrant encore plus d'automatisation pour les sources de données les plus populaires. Ils étendent la fonctionnalité des LakeFlow Pipelines pour inclure également l'authentification spécifique à la source, la CDC, la gestion des cas extrêmes, la maintenance à long terme des API, les nouvelles tentatives automatisées, l'évolution des schémas automatisée, et ainsi de suite. Par conséquent, ils offrent encore plus d'automatisation pour toutes les sources de données prises en charge.

Connecteurs gérés​

Vous pouvez utiliser des connecteurs entièrement managés pour ingérer des données à partir d’applications d’entreprise et de bases de données. Consultez les concepts des connecteurs Lakeflow Connect pour obtenir une liste complète des connecteurs pris en charge.

Les interfaces prises en charge comprennent :

  • Interface utilisateur Databricks
  • Declarative Automation Bundles
  • APIs Databricks
  • SDK Databricks
  • Databricks CLI

Connecteurs Communauté​

Les connecteurs Communauté étendent Lakeflow Connect aux sources ne bénéficiant pas de connecteurs gérés. Ils sont open source, créés et maintenus par la Communauté, et ne sont pas couverts par les SLA de Databricks. Utilisez un connecteur déjà enregistré par la Communauté pour ingérer des données depuis une source prise en charge. Voir Connecteurs Communauté dans Lakeflow Connect.

Connecteurs personnalisés​

Les connecteurs personnalisés vous permettent de créer votre propre connecteur pour une source qui ne dispose pas de connecteur géré. Vous créez, testez, déployez et exécutez un connecteur personnalisé dans votre propre workspace Databricks, sans l'enregistrer auprès de la communauté. Voir Créer un connecteur personnalisé pour LakeFlow Connect.

SQL et Spark APIs​

Outre les connecteurs managés, Databricks propose des API SQL et Spark API personnalisables pour l’ingestion à partir de stockages d’objets cloud et de bus de messages. Voir Ingestion avec SQL et les Spark API.

Créer ou modifier une table à partir d'un upload de fichier (IU d'ajout de données)​

Vous pouvez ingérer des fichiers qui résident sur votre réseau local, des fichiers upload vers un volume ou des fichiers download à partir d'un emplacement Internet. Consultez Créer ou modifier une table à l'aide d'un upload de fichier.

Partenaires d'ingestion​

De nombreux outils tiers prennent en charge l'ingestion par batch ou en streaming dans Databricks. Databricks valide diverses intégrations tierces, bien que les étapes pour configurer l'accès aux systèmes sources et ingérer les données varient selon l'outil. Consultez les Partenaires d'ingestion pour une liste d'outils validés. Certains partenaires technologiques sont également présentés dans Databricks Partner Connect, qui dispose d'une interface utilisateur simplifiant la connexion des outils tiers aux données du Lakehouse.

Ingestion autonome​

Databricks fournit une plateforme de compute générale. Ainsi, vous pouvez créer vos propres connecteurs d'ingestion en utilisant n'importe quel langage de programmation pris en charge par Databricks, comme Python ou Java. Vous pouvez également importer et utiliser des bibliothèques de connecteurs open source populaires comme data load tool, Airbyte et Debezium.

Alternatives d'ingestion​

Databricks recommande l'ingestion pour la plupart des cas d'utilisation, car elle monte en charge pour s'adapter aux volumes de données élevés, aux requêtes à faible latence et aux limites des API tierces. L'ingestion copie les données de vos systèmes sources vers Databricks, ce qui entraîne des données en double qui pourraient devenir obsolètes avec le temps. Si vous ne souhaitez pas copier de données, vous pouvez utiliser les outils suivants :

Outil

Description

Lakehouse Federation

Vous permet de query des sources de données externes sans déplacer vos données.

OpenSharing

Permet de partager des données en toute sécurité entre plateformes, clouds et régions.

Outil

Description

Lakehouse Federation

Vous permet de query des sources de données externes sans déplacer vos données.

OpenSharing

Permet de partager des données en toute sécurité entre plateformes, clouds et régions.