Aller au contenu principal

Connecteurs de base de données gérés

Databricks Lakeflow Connect fournit des connecteurs entièrement managés pour l'ingestion de données à partir de bases de données relationnelles à l'aide de la capture de données modifiées (CDC). Chaque connecteur suit efficacement les changements dans la base de données source et les applique de manière incrémentielle aux tables Delta.

Connecteurs pris en charge

    • MySQL
    • Ingérer des données depuis des bases de données MySQL en utilisant la capture de données modifiées (CDC) pour des chargements incrémentiels efficaces.
    • PostgreSQL
    • Ingérez les données des bases de données PostgreSQL en utilisant la capture des modifications (CDC).
    • Microsoft SQL Server
    • Ingérer des données de Microsoft SQL Server en utilisant la capture des changements de données (CDC) ou un instantané complet.

Composants de connecteur

Un connecteur de base de données comprend les composants suivants :

Composant

Description

Connexion

Un objet sécurisable de Unity Catalog qui stocke les informations d'authentification pour la base de données.

Passerelle d'ingestion

Un pipeline qui extrait des instantanés, des logs de modifications et des métadonnées de la base de données source. La passerelle s’exécute sur le compute classique et elle s’exécute en continu pour capturer les modifications avant que les logs de modification ne puissent être tronqués dans la source.

Stockage intermédiaire

Un volume Unity Catalog qui stocke temporairement les données extraites avant qu'elles ne soient appliquées à la table de destination. Cela vous permet d'exécuter votre pipeline d'ingestion selon le calendrier de votre choix, même si la passerelle capture continuellement les changements. Cela aide également à la récupération après défaillance. Vous créez automatiquement un volume de stockage de staging lorsque vous déployez la passerelle, et vous pouvez personnaliser le catalogue et le schéma où il réside. Les données sont automatiquement purgées de la zone de staging après 30 jours.

pipeline d'ingestion

Un pipeline qui déplace les données du stockage de préproduction vers les tables de destination. Le pipeline s'exécute sur un compute Serverless. Étant donné que la passerelle d'ingestion s'exécute en continu, vous provisionnez et payez pour son compute classique même lorsque votre pipeline d'ingestion est inactif. Dimensionnez ce compute pour votre charge de travail, car l'instantané initial peut échouer sur un compute sous-dimensionné. Pour les exigences minimales et les recommandations de dimensionnement, consultez la page du pipeline de votre connecteur.

Tables de destination

Les tables où le pipeline d'ingestion écrit les données. Ce sont des tables de streaming, qui sont des tables Delta avec un support supplémentaire pour le traitement incémentiel des données.

Composant

Description

Connexion

Un objet sécurisable de Unity Catalog qui stocke les informations d'authentification pour la base de données.

Passerelle d'ingestion

Un pipeline qui extrait des instantanés, des logs de modifications et des métadonnées de la base de données source. La passerelle s’exécute sur le compute classique et elle s’exécute en continu pour capturer les modifications avant que les logs de modification ne puissent être tronqués dans la source.

Stockage intermédiaire

Un volume Unity Catalog qui stocke temporairement les données extraites avant qu'elles ne soient appliquées à la table de destination. Cela vous permet d'exécuter votre pipeline d'ingestion selon le calendrier de votre choix, même si la passerelle capture continuellement les changements. Cela aide également à la récupération après défaillance. Vous créez automatiquement un volume de stockage de staging lorsque vous déployez la passerelle, et vous pouvez personnaliser le catalogue et le schéma où il réside. Les données sont automatiquement purgées de la zone de staging après 30 jours.

pipeline d'ingestion

Un pipeline qui déplace les données du stockage de préproduction vers les tables de destination. Le pipeline s'exécute sur un compute Serverless. Étant donné que la passerelle d'ingestion s'exécute en continu, vous provisionnez et payez pour son compute classique même lorsque votre pipeline d'ingestion est inactif. Dimensionnez ce compute pour votre charge de travail, car l'instantané initial peut échouer sur un compute sous-dimensionné. Pour les exigences minimales et les recommandations de dimensionnement, consultez la page du pipeline de votre connecteur.

Tables de destination

Les tables où le pipeline d'ingestion écrit les données. Ce sont des tables de streaming, qui sont des tables Delta avec un support supplémentaire pour le traitement incémentiel des données.

Diagramme des composants du connecteur de base de données

Connectivité réseau

La passerelle d’ingestion s’exécute sur le compute classique dans le Virtual Private Cloud (VPC) ou VNet de votre Workspace Databricks, et doit pouvoir atteindre la base de données source via le réseau.

Tout chemin réseau permettant à la passerelle d'atteindre la base de données est pris en charge, y compris VPN, Azure ExpressRoute, AWS Direct Connect, le peering Virtual Private Cloud (VPC) ou VNet, et les Endpoint publics.

La connectivité cross-cloud est prise en charge. Par exemple, un Workspace Azure Databricks peut ingérer des données depuis une base de données AWS Aurora PostgreSQL si la connectivité réseau appropriée existe entre les deux environnements.