Connecteur CDC intégré Oracle
Bêta
Cette fonctionnalité est en version Bêta. Les administrateurs du workspace peuvent contrôler l'accès à cette fonctionnalité depuis la page Aperçus . Voir Gérer les aperçus Databricks.
Cette page vous aide à comprendre le workflow d'ingestion Oracle, y compris les facteurs qui déterminent votre approche de configuration et les étapes impliquées pour les différents profils d'utilisateurs.
Le connecteur CDC intégré Oracle utilise un pipeline CDC intégré : un pipeline unique extrait les modifications d’Oracle à l’aide de LogMiner et les applique aux tables de streaming de destination, sans passerelle d’ingestion distincte. Pour le modèle de composant, consultez les composants du connecteur.
Avant de créer un pipeline d'ingestion CDC intégré pour Oracle, vous devez configurer la base de données source directement dans Oracle : activez le mode archive log, activez la journalisation supplémentaire sur les tables que vous répliquez et créez un utilisateur de réplication disposant des privilèges requis. Effectuez d'abord ces tâches. Voir Configurer Oracle pour l'ingestion dans Databricks.
Disponibilité des fonctionnalités
La même disponibilité des fonctionnalités s’applique à Databricks sur AWS, Azure et GCP.
Fonctionnalité | Disponibilité |
|---|---|
Conception de pipelines via l'interface utilisateur |
|
Création de pipeline par API |
|
Declarative Automation Bundles |
|
Ingestion incrémentielle |
|
Gouvernance Unity Catalog |
|
Orchestration avec Lakeflow Jobs |
|
SCD de type 2 |
|
Sélection et désélection de colonnes via API |
|
Filtrage des lignes basé sur l'API |
|
Évolution automatique des schémas : Nouvelles colonnes et colonnes supprimées |
La réajout d’une colonne supprimée portant le même nom n’est pas prise en charge. |
Évolution automatisée des schémas : changements de type de données |
Élargissement de type uniquement. Un changement de type non élargi (rétrécissement) nécessite un refresh complet. |
évolution des schémas automatisée : Renommage de colonnes |
|
Évolution automatisée des schémas : renommages de tables |
|
Évolution des schémas automatisée : nouvelles tables |
Si vous ingérez le schéma entier. Consultez les limitations concernant le nombre de tables par pipeline. |
Refresh complet automatique |
Effectue automatiquement un full-refresh des tables concernées pour récupérer après des changements de schéma non pris en charge. Voir la politique de refresh complet automatique. |
Nombre maximal de tables par pipeline | 250 |
Méthodes d'authentification
Le connecteur prend uniquement en charge l’authentification de base avec un nom d’utilisateur et un mot de passe Oracle. Voir Créer une connexion Oracle.
Ingérer à partir d'Oracle en 3 étapes
Avant de commencer, passez en revue la persona utilisateur Databricks, la variation de base de données, les méthodes d’authentification, les interfaces prises en charge, la fréquence d’ingestion et les modèles courants.
- Configurer Oracle pour l'ingestion (Admins) — Activez le mode archive log, activez la journalisation supplémentaire sur les tables que vous répliquez et créez un utilisateur de réplication avec les privilèges requis.
- Créer une connexion Unity Catalog (Admins) — Créez une connexion dans l’Explorateur de catalogues afin que les non-admins puissent créer des pipelines.
- Créer un pipeline d’ingestion (Admins ou non-admins) — Sélectionnez n’importe quelle interface prise en charge et créez un pipeline à partir d’une connexion existante.