Qu’est-ce que Lakeflow Connect ?
Lakeflow Connect offre des connecteurs simples et efficaces pour ingérer des données provenant de fichiers locaux, d'applications d'entreprise populaires, de bases de données, de stockage cloud, de bus de messages, et bien plus encore. Cette page présente certaines des façons dont Lakeflow Connect peut améliorer les performances ETL. Il couvre également les cas d'utilisation courants et la gamme d'outils d'ingestion pris en charge, des connecteurs entièrement managés aux frameworks entièrement personnalisables.
Modèles de service flexibles
Lakeflow Connect propose une large gamme de connecteurs pour les applications d'entreprise, les stockages cloud, les bases de données, les bus de messages, et plus encore. Il vous offre également la flexibilité de choisir parmi les options suivantes :
Option | Description |
|---|---|
Un service entièrement managé | Des connecteurs intégrés qui démocratisent l'accès aux données grâce à des interfaces utilisateur simples et des APIs puissantes. Ceci vous permet de créer rapidement des pipelines d’ingestion robustes tout en minimisant les coûts de maintenance à long terme. |
Un pipeline personnalisé | Si vous avez besoin de plus de personnalisation, vous pouvez utiliser les LakeFlow Pipelines ou le Structured Streaming. En fin de compte, cette polyvalence permet à Lakeflow Connect de répondre aux besoins spécifiques de votre organisation. |
Unification avec les outils Databricks principaux
Lakeflow Connect utilise les fonctionnalités clés de Databricks pour fournir une gestion de données complète. Par exemple, il offre une gouvernance utilisant Unity Catalog, une orchestration utilisant Lakeflow Jobs et un monitoring holistique sur vos pipelines. Cela aide votre organisation à gérer la sécurité, la qualité et le coût des données tout en unifiant vos processus d'ingestion avec vos autres outils de Data Engineering. Lakeflow Connect est basé sur une Data Intelligence Platform ouverte, offrant une flexibilité totale pour intégrer vos outils tiers préférés. Cela garantit une solution sur mesure qui s'aligne sur votre infrastructure existante et vos futures stratégies de données.
Ingestion rapide et évolutive
Lakeflow Connect utilise des lectures et des écritures incrémentielles pour permettre une ingestion efficace. Combiné avec des Transformations incrémentielles en aval, cela peut améliorer considérablement les performances de l'ETL.
Cas d'utilisation courants
Les clients ingèrent des données pour résoudre les problèmes les plus complexes de leurs organisations. Exemples de cas d'utilisation comprennent les éléments suivants :
Cas d'usage | Description |
|---|---|
Mesure de la performance des campagnes et notation des leads clients | |
Maximisation du ROI avec des modèles historiques et de prévision. | |
Personnalisation des expériences d'achat de vos clients | |
Ressources humaines centralisées | Soutenir les équipes de votre organisation |
Améliorer l'efficacité de la fabrication | |
Créer des chatbots pour aider les utilisateurs à comprendre les politiques, les produits et plus encore |
Couches de la pile ETL
Certains connecteurs fonctionnent à un niveau de la pile ETL. Par exemple, Databricks propose des connecteurs entièrement managés pour les applications d'entreprise comme Salesforce et les bases de données comme SQL Server. D'autres connecteurs fonctionnent à une couche différente de la pile ETL. Par exemple, vous pouvez utiliser des connecteurs standard dans les LakeFlow Pipelines pour plus d'options de personnalisation. De même, vous pouvez choisir votre niveau de personnalisation pour les données de streaming provenant d'Apache Kafka, Amazon Kinesis, Google Pub/Sub et Apache Pulsar.
Databricks recommande de commencer par la couche la plus gérée. Si cela ne répond pas à vos exigences (par exemple, si cela ne prend pas en charge votre source de données), passez à la couche suivante.
Le tableau suivant décrit les couches des produits d’ingestion :
Couche | Description |
|---|---|
Les LakeFlow Pipelines offrent un cadre déclaratif pour la création de pipelines de données. Définissez vos Transformations, et LakeFlow Pipelines gèrent l'orchestration, le monitoring, la qualité des données, les erreurs, et bien plus encore. Ils s'appuient sur Structured Streaming pour le streaming et prennent en charge la plupart des fonctionnalités de Structured Streaming. Pour toute fonctionnalité de Structured Streaming non encore disponible dans les Lakeflow pipelines, vous pouvez utiliser directement les APIs de Structured Streaming. | |
Les connecteurs entièrement managés s'appuient sur les Lakeflow Pipelines, offrant encore plus d'automatisation pour les sources de données les plus populaires. Ils étendent la fonctionnalité des LakeFlow Pipelines pour inclure également l'authentification spécifique à la source, la CDC, la gestion des cas extrêmes, la maintenance à long terme des API, les nouvelles tentatives automatisées, l'évolution des schémas automatisée, et ainsi de suite. Par conséquent, ils offrent encore plus d'automatisation pour toutes les sources de données prises en charge. |
Connecteurs gérés
Vous pouvez utiliser des connecteurs entièrement managés pour l'ingestion à partir d'applications d'entreprise et de bases de données. Consultez Connecteurs gérés dans Lakeflow Connect pour une liste complète des connecteurs pris en charge.
Les interfaces prises en charge comprennent :
- Interface utilisateur Databricks
- Declarative Automation Bundles
- APIs Databricks
- SDK Databricks
- Databricks CLI
Connecteurs Communauté
Les connecteurs communautaires étendent Lakeflow Connect aux sources sans prise en charge des connecteurs gérés. Ils sont créés et gérés par la communauté et ne sont pas couverts par les SLA de Databricks. Vous pouvez utiliser un connecteur existant ou créer le vôtre. Consultez les connecteurs Communauté dans Lakeflow Connect.
Connecteurs standard
En plus des connecteurs gérés, Databricks propose des connecteurs personnalisables pour le stockage d'objets cloud et les bus de messages. Consultez les connecteurs standard de LakeFlow Connect.
Créer ou modifier une table à partir d'un upload de fichier (IU d'ajout de données)
Vous pouvez ingérer des fichiers qui résident sur votre réseau local, des fichiers upload vers un volume ou des fichiers download à partir d'un emplacement Internet. Consultez Créer ou modifier une table à l'aide d'un upload de fichier.
Partenaires d'ingestion
De nombreux outils tiers prennent en charge l'ingestion par batch ou en streaming dans Databricks. Databricks valide diverses intégrations tierces, bien que les étapes pour configurer l'accès aux systèmes sources et ingérer les données varient selon l'outil. Consultez les Partenaires d'ingestion pour une liste d'outils validés. Certains partenaires technologiques sont également présentés dans Databricks Partner Connect, qui dispose d'une interface utilisateur simplifiant la connexion des outils tiers aux données du Lakehouse.
Ingestion autonome
Databricks fournit une plateforme de compute générale. Ainsi, vous pouvez créer vos propres connecteurs d'ingestion en utilisant n'importe quel langage de programmation pris en charge par Databricks, comme Python ou Java. Vous pouvez également importer et utiliser des bibliothèques de connecteurs open source populaires comme data load tool, Airbyte et Debezium.
Alternatives d'ingestion
Databricks recommande l'ingestion pour la plupart des cas d'utilisation, car elle monte en charge pour s'adapter aux volumes de données élevés, aux requêtes à faible latence et aux limites des API tierces. L'ingestion copie les données de vos systèmes sources vers Databricks, ce qui entraîne des données en double qui pourraient devenir obsolètes avec le temps. Si vous ne souhaitez pas copier de données, vous pouvez utiliser les outils suivants :
Outil | Description |
|---|---|
Lakehouse Federation | Vous permet de query des sources de données externes sans déplacer vos données. |
OpenSharing | Permet de partager des données en toute sécurité entre plateformes, clouds et régions. |