Connecteur Kafka.
Bêta
Cette fonctionnalité est en Bêta. Les administrateurs du Workspace peuvent contrôler l'accès à cette fonctionnalité à partir de la page Previews . Consultez Gérer les aperçus Databricks.
Le connecteur Kafka géré dans Lakeflow Connect vous permet d'ingérer des données de sujets Apache Kafka dans des tables de streaming dans Databricks.
Vous pouvez également acheminer des enregistrements d'une seule source Kafka vers plusieurs tables de destination en fonction d'une clé de routage par enregistrement (diffusion en éventail, en avant-première privée). Voir Acheminer les enregistrements vers plusieurs tables (diffusion en éventail).
Composants du connecteur Kafka
Composant | Description |
|---|---|
Connexion | Un objet sécurisable Unity Catalog qui stocke l'adresse du serveur d'amorçage et les informations d'identification d'authentification pour votre cluster Kafka. Le connecteur Kafka géré utilise cette connexion pour s'authentifier sans nécessiter d'identifiants dans la configuration de votre pipeline. |
pipeline d'ingestion | Un pipeline qui lit en continu à partir d'un ou plusieurs sujets Kafka et écrit les résultats dans des tables de streaming. Le pipeline s'exécute sur du compute serverless. |
Tables de destination | Les tables de streaming où le pipeline d'ingestion écrit les données. |
Start ingesting from Apache Kafka
Le tableau suivant fournit un aperçu du flux d'ingestion Kafka de bout en bout, basé sur le type d'utilisateur :
Utilisateur | Étapes |
|---|---|
Admin | Utilisez l'Explorateur de catalogues pour créer une connexion afin que tout utilisateur disposant de |
Non-administrateur | Utilisez toute interface prise en charge pour créer un pipeline à partir d'une connexion existante. Voir Ingérer des données d'Apache Kafka. |
Disponibilité des fonctionnalités
Fonctionnalité | Disponibilité |
|---|---|
Conception de pipelines via l'interface utilisateur |
|
Création de pipeline par API |
|
Declarative Automation Bundles |
|
Ingestion en streaming continue |
|
Gouvernance Unity Catalog |
|
Orchestration à l'aide de Databricks Workflows |
|
SCD de type 2 |
|
Sélection et désélection de colonne |
|
Filtrage des lignes |
|
Évolution des schémas automatisée : Nouvelles colonnes |
|
Évolution automatisée des schémas : changements de type de données |
|
évolution des schémas automatisée : Renommage de colonnes |
|
Méthodes d'authentification
Méthode d'authentification | Disponibilité |
|---|---|
Nom d'utilisateur et mot de passe |
|
Identifiant de service |
|
OAuth U2M |
|
OAuth M2M |
|