Aller au contenu principal

Connecteurs de streaming

Databricks Lakeflow Connect dispose de connecteurs de streaming entièrement managés pour ingérer en continu des données provenant de bus de messages et de sources de streaming d'événements dans des tables de streaming. Chaque connecteur managé gère l'authentification pour chaque source, le décodage des messages et la gestion du cycle de vie du pipeline via une configuration déclarative, de sorte que vous n'avez pas besoin d'écrire directement du code Structured Streaming. Pour les sources sans connecteur managé, vous pouvez stream directement en utilisant Structured Streaming ou les Lakeflow pipelines.

Connecteurs de streaming gérés

    • Kafka
    • Stream des données depuis des topics Apache Kafka vers des tables de streaming.
    • RabbitMQ
    • Stream messages des files d'attente classiques RabbitMQ dans des tables de streaming.

Stream à partir d'autres sources

Pour les sources de streaming sans connecteur managé, notamment Amazon Kinesis, Google Pub/Sub et Apache Pulsar, vous pouvez streamer directement avec Structured Streaming ou les LakeFlow Pipelines. Vous pouvez également lire directement depuis Apache Kafka avec Structured Streaming lorsque vous avez besoin d'un contrôle plus précis sur la lecture et le traitement du Stream que ce que propose le connecteur Kafka managé, comme la gestion personnalisée des offsets ou les Transformations par batch. Pour choisir un connecteur par source et par niveau de personnalisation du pipeline, consultez Choisir un connecteur standard.

Composants de connecteur

Un connecteur de streaming a les composantes suivantes :

Composant

Description

Connexion

Un objet sécurisable Unity Catalog qui stocke l'Endpoint source et les justificatifs d'authentification pour votre source de streaming. Le connecteur géré utilise cette connexion pour s'authentifier sans nécessiter de justificatifs dans la configuration de votre pipeline.

pipeline d'ingestion

Un pipeline qui lit en continu les messages de la source de streaming et écrit les résultats dans des tables de streaming. Le pipeline s'exécute sur le compute Serverless.

Tables de destination

Les tables de streaming où le pipeline d'ingestion écrit les données.

Composant

Description

Connexion

Un objet sécurisable Unity Catalog qui stocke l'Endpoint source et les justificatifs d'authentification pour votre source de streaming. Le connecteur géré utilise cette connexion pour s'authentifier sans nécessiter de justificatifs dans la configuration de votre pipeline.

pipeline d'ingestion

Un pipeline qui lit en continu les messages de la source de streaming et écrit les résultats dans des tables de streaming. Le pipeline s'exécute sur le compute Serverless.

Tables de destination

Les tables de streaming où le pipeline d'ingestion écrit les données.