Aller au contenu principal

Qu’est-ce que Lakeflow Connect ?

Lakeflow Connect offre des connecteurs simples et efficaces pour ingérer des données provenant de fichiers locaux, d'applications d'entreprise populaires, de bases de données, de stockage cloud, de bus de messages, et bien plus encore. Cette page présente certaines des façons dont Lakeflow Connect peut améliorer les performances ETL. Il couvre également les cas d'utilisation courants et la gamme d'outils d'ingestion pris en charge, des connecteurs entièrement managés aux frameworks entièrement personnalisables.

Modèles de service flexibles

Lakeflow Connect propose une large gamme de connecteurs pour les applications d'entreprise, les stockages cloud, les bases de données, les bus de messages, et plus encore. Il vous offre également la flexibilité de choisir parmi les options suivantes :

Option

Description

Un service entièrement managé

Des connecteurs intégrés qui démocratisent l'accès aux données grâce à des interfaces utilisateur simples et des APIs puissantes. Ceci vous permet de créer rapidement des pipelines d’ingestion robustes tout en minimisant les coûts de maintenance à long terme.

Un pipeline personnalisé

Si vous avez besoin de plus de personnalisation, vous pouvez utiliser les LakeFlow Pipelines ou le Structured Streaming. En fin de compte, cette polyvalence permet à Lakeflow Connect de répondre aux besoins spécifiques de votre organisation.

Option

Description

Un service entièrement managé

Des connecteurs intégrés qui démocratisent l'accès aux données grâce à des interfaces utilisateur simples et des APIs puissantes. Ceci vous permet de créer rapidement des pipelines d’ingestion robustes tout en minimisant les coûts de maintenance à long terme.

Un pipeline personnalisé

Si vous avez besoin de plus de personnalisation, vous pouvez utiliser les LakeFlow Pipelines ou le Structured Streaming. En fin de compte, cette polyvalence permet à Lakeflow Connect de répondre aux besoins spécifiques de votre organisation.

Unification avec les outils Databricks principaux

Lakeflow Connect utilise les fonctionnalités clés de Databricks pour fournir une gestion de données complète. Par exemple, il offre une gouvernance utilisant Unity Catalog, une orchestration utilisant Lakeflow Jobs et un monitoring holistique sur vos pipelines. Cela aide votre organisation à gérer la sécurité, la qualité et le coût des données tout en unifiant vos processus d'ingestion avec vos autres outils de Data Engineering. Lakeflow Connect est basé sur une Data Intelligence Platform ouverte, offrant une flexibilité totale pour intégrer vos outils tiers préférés. Cela garantit une solution sur mesure qui s'aligne sur votre infrastructure existante et vos futures stratégies de données.

Ingestion rapide et évolutive

Lakeflow Connect utilise des lectures et des écritures incrémentielles pour permettre une ingestion efficace. Combiné avec des Transformations incrémentielles en aval, cela peut améliorer considérablement les performances de l'ETL.

Cas d'utilisation courants

Les clients ingèrent des données pour résoudre les problèmes les plus complexes de leurs organisations. Exemples de cas d'utilisation comprennent les éléments suivants :

Cas d'usage

Description

Vue à 360° du client

Mesure de la performance des campagnes et notation des leads clients

Gestion de portefeuille

Maximisation du ROI avec des modèles historiques et de prévision.

Analytique consommateur

Personnalisation des expériences d'achat de vos clients

Ressources humaines centralisées

Soutenir les équipes de votre organisation

Jumeaux numériques

Améliorer l'efficacité de la fabrication

Chatbots RAG

Créer des chatbots pour aider les utilisateurs à comprendre les politiques, les produits et plus encore

Cas d'usage

Description

Vue à 360° du client

Mesure de la performance des campagnes et notation des leads clients

Gestion de portefeuille

Maximisation du ROI avec des modèles historiques et de prévision.

Analytique consommateur

Personnalisation des expériences d'achat de vos clients

Ressources humaines centralisées

Soutenir les équipes de votre organisation

Jumeaux numériques

Améliorer l'efficacité de la fabrication

Chatbots RAG

Créer des chatbots pour aider les utilisateurs à comprendre les politiques, les produits et plus encore

Couches de la pile ETL

Certains connecteurs fonctionnent à un niveau de la pile ETL. Par exemple, Databricks propose des connecteurs entièrement managés pour les applications d'entreprise comme Salesforce et les bases de données comme SQL Server. D'autres connecteurs fonctionnent à une couche différente de la pile ETL. Par exemple, vous pouvez utiliser des connecteurs standard dans les LakeFlow Pipelines pour plus d'options de personnalisation. De même, vous pouvez choisir votre niveau de personnalisation pour les données de streaming provenant d'Apache Kafka, Amazon Kinesis, Google Pub/Sub et Apache Pulsar.

Databricks recommande de commencer par la couche la plus gérée. Si cela ne répond pas à vos exigences (par exemple, si cela ne prend pas en charge votre source de données), passez à la couche suivante.

Le tableau suivant décrit les couches des produits d’ingestion :

Couche

Description

LakeFlow Pipelines

Les LakeFlow Pipelines offrent un cadre déclaratif pour la création de pipelines de données. Définissez vos Transformations, et LakeFlow Pipelines gèrent l'orchestration, le monitoring, la qualité des données, les erreurs, et bien plus encore. Ils s'appuient sur Structured Streaming pour le streaming et prennent en charge la plupart des fonctionnalités de Structured Streaming. Pour toute fonctionnalité de Structured Streaming non encore disponible dans les Lakeflow pipelines, vous pouvez utiliser directement les APIs de Structured Streaming.

Connecteurs entièrement managés

Les connecteurs entièrement managés s'appuient sur les Lakeflow Pipelines, offrant encore plus d'automatisation pour les sources de données les plus populaires. Ils étendent la fonctionnalité des LakeFlow Pipelines pour inclure également l'authentification spécifique à la source, la CDC, la gestion des cas extrêmes, la maintenance à long terme des API, les nouvelles tentatives automatisées, l'évolution des schémas automatisée, et ainsi de suite. Par conséquent, ils offrent encore plus d'automatisation pour toutes les sources de données prises en charge.

Couche

Description

LakeFlow Pipelines

Les LakeFlow Pipelines offrent un cadre déclaratif pour la création de pipelines de données. Définissez vos Transformations, et LakeFlow Pipelines gèrent l'orchestration, le monitoring, la qualité des données, les erreurs, et bien plus encore. Ils s'appuient sur Structured Streaming pour le streaming et prennent en charge la plupart des fonctionnalités de Structured Streaming. Pour toute fonctionnalité de Structured Streaming non encore disponible dans les Lakeflow pipelines, vous pouvez utiliser directement les APIs de Structured Streaming.

Connecteurs entièrement managés

Les connecteurs entièrement managés s'appuient sur les Lakeflow Pipelines, offrant encore plus d'automatisation pour les sources de données les plus populaires. Ils étendent la fonctionnalité des LakeFlow Pipelines pour inclure également l'authentification spécifique à la source, la CDC, la gestion des cas extrêmes, la maintenance à long terme des API, les nouvelles tentatives automatisées, l'évolution des schémas automatisée, et ainsi de suite. Par conséquent, ils offrent encore plus d'automatisation pour toutes les sources de données prises en charge.

Connecteurs gérés

Vous pouvez utiliser des connecteurs entièrement managés pour l'ingestion à partir d'applications d'entreprise et de bases de données. Consultez Connecteurs gérés dans Lakeflow Connect pour une liste complète des connecteurs pris en charge.

Les interfaces prises en charge comprennent :

  • Interface utilisateur Databricks
  • Declarative Automation Bundles
  • APIs Databricks
  • SDK Databricks
  • Databricks CLI

Connecteurs Communauté

Les connecteurs communautaires étendent Lakeflow Connect aux sources sans prise en charge des connecteurs gérés. Ils sont créés et gérés par la communauté et ne sont pas couverts par les SLA de Databricks. Vous pouvez utiliser un connecteur existant ou créer le vôtre. Consultez les connecteurs Communauté dans Lakeflow Connect.

Connecteurs standard

En plus des connecteurs gérés, Databricks propose des connecteurs personnalisables pour le stockage d'objets cloud et les bus de messages. Consultez les connecteurs standard de LakeFlow Connect.

Créer ou modifier une table à partir d'un upload de fichier (IU d'ajout de données)

Vous pouvez ingérer des fichiers qui résident sur votre réseau local, des fichiers upload vers un volume ou des fichiers download à partir d'un emplacement Internet. Consultez Créer ou modifier une table à l'aide d'un upload de fichier.

Partenaires d'ingestion

De nombreux outils tiers prennent en charge l'ingestion par batch ou en streaming dans Databricks. Databricks valide diverses intégrations tierces, bien que les étapes pour configurer l'accès aux systèmes sources et ingérer les données varient selon l'outil. Consultez les Partenaires d'ingestion pour une liste d'outils validés. Certains partenaires technologiques sont également présentés dans Databricks Partner Connect, qui dispose d'une interface utilisateur simplifiant la connexion des outils tiers aux données du Lakehouse.

Ingestion autonome

Databricks fournit une plateforme de compute générale. Ainsi, vous pouvez créer vos propres connecteurs d'ingestion en utilisant n'importe quel langage de programmation pris en charge par Databricks, comme Python ou Java. Vous pouvez également importer et utiliser des bibliothèques de connecteurs open source populaires comme data load tool, Airbyte et Debezium.

Alternatives d'ingestion

Databricks recommande l'ingestion pour la plupart des cas d'utilisation, car elle monte en charge pour s'adapter aux volumes de données élevés, aux requêtes à faible latence et aux limites des API tierces. L'ingestion copie les données de vos systèmes sources vers Databricks, ce qui entraîne des données en double qui pourraient devenir obsolètes avec le temps. Si vous ne souhaitez pas copier de données, vous pouvez utiliser les outils suivants :

Outil

Description

Lakehouse Federation

Vous permet de query des sources de données externes sans déplacer vos données.

OpenSharing

Permet de partager des données en toute sécurité entre plateformes, clouds et régions.

Outil

Description

Lakehouse Federation

Vous permet de query des sources de données externes sans déplacer vos données.

OpenSharing

Permet de partager des données en toute sécurité entre plateformes, clouds et régions.