Connecteur d'importation PostgreSQL
Aperçu
Le connecteur PostgreSQL est en préversion publique. Contactez votre équipe de compte Databricks pour demander l'accès.
Cette page vous aide à comprendre le workflow d'ingestion PostgreSQL, y compris les facteurs qui déterminent votre approche de configuration et les étapes impliquées pour les différents profils d'utilisateurs.
Avant de créer un pipeline d’ingestion PostgreSQL, vous devez configurer la base de données source directement dans PostgreSQL : activer la réplication logique, créer un utilisateur de réplication et créer des publications et des emplacements de réplication. Terminez ces tâches d’abord. Voir Configurer PostgreSQL pour l’ingestion dans Databricks.
Disponibilité des fonctionnalités
Fonctionnalité | Disponibilité |
|---|---|
Conception de pipelines via l'interface utilisateur |
|
Création de pipeline par API |
|
Declarative Automation Bundles |
|
Ingestion incrémentielle |
|
Gouvernance Unity Catalog |
|
Orchestration à l'aide de Databricks Workflows |
|
SCD de type 2 |
|
Sélection et désélection de colonnes via API |
|
Filtrage des lignes basé sur l'API |
|
Évolution automatique des schémas : Nouvelles colonnes et colonnes supprimées |
|
Évolution automatisée des schémas : changements de type de données |
|
évolution des schémas automatisée : Renommage de colonnes |
Nécessite un full refresh. |
Évolution des schémas automatisée : nouvelles tables |
Si vous ingérez l’intégralité du schéma. Consulter les limites sur le nombre de tables par pipeline. |
Nombre maximal de tables par pipeline | 250 |
Méthodes d'authentification
Méthode d'authentification | Disponibilité |
|---|---|
OAuth U2M |
|
OAuth M2M |
|
OAuth (jeton de refresh manuel) |
|
Authentification de base (nom d’utilisateur/mot de passe) |
|
Authentification de base (clé API) |
|
Authentification de base (clé JSON du compte de service) |
|
Ce qu'il faut savoir avant de start
Sujet | Pourquoi c'est important |
|---|---|
Le workflow dépend de votre persona utilisateur Databricks :
| |
La configuration de la base de données source dépend de l'environnement de déploiement PostgreSQL. | |
Les étapes de création d’une connexion dépendent de la méthode d’authentification que vous choisissez. | |
Les étapes pour créer une connexion, une passerelle et un pipeline dépendent de l'interface. | |
La planification du pipeline dépend de vos exigences en matière de latence et de coût. | |
Selon vos besoins d'ingestion, le pipeline peut utiliser des configurations comme le suivi de l'historique, la sélection de colonnes et le filtrage de lignes. Les configurations prises en charge varient selon le connecteur. Voir Disponibilité des fonctionnalités. |
Start l'ingestion depuis PostgreSQL
Le tableau suivant présente un aperçu du workflow d’ingestion PostgreSQL de bout en bout, basé sur le type d’utilisateur :
Utilisateur | Étapes |
|---|---|
Admin |
|
Non-administrateur | Utilisez toute interface prise en charge pour créer une passerelle et un pipeline. Consultez Ingérer des données depuis PostgreSQL. |