Aller au contenu principal

Concepts du connecteur CDC intégré Oracle

info

Bêta

Cette fonctionnalité est en version bêta. Les administrateurs du Workspace peuvent contrôler l’accès à cette fonctionnalité depuis la page Aperçus . Voir Gérer les aperçus Databricks.

Cette page décrit le fonctionnement du connecteur CDC intégré d'Oracle, y compris ses concepts fondamentaux.

Comment Databricks se connecte-t-il à Oracle ?

Databricks se connecte à Oracle à l'aide d'une connexion JDBC. Les identifiants sont stockés de manière sécurisée dans Unity Catalog et ne peuvent être récupérés que si l'utilisateur exécutant le flux d'ingestion dispose des autorisations appropriées. Databricks recommande de créer un utilisateur Oracle distinct utilisé uniquement pour l'ingestion de données. S'il existe des schémas ou des tables que vous ne souhaitez pas exposer à cet utilisateur, vous pouvez utiliser les privilèges Oracle intégrés.

Comment le connecteur extrait-il les données de manière incrémentielle ?

Le connecteur utilise Oracle LogMiner en mode de transaction non validée pour lire les changements à la fois dans les logs redo en ligne et dans les logs d'archive. Lors de la première exécution d'un pipeline, ou après un refresh complet, le connecteur capture un instantané initial de chaque table sélectionnée. Lors des exécutions ultérieures, il capture les changements incrémentiels (insertions, mises à jour et suppressions) à partir des Logs.

Comme le connecteur lit les logs d'archive, la base de données source doit fonctionner en mode archive log et conserver les logs d'archive suffisamment longtemps pour que le pipeline puisse les traiter. Databricks recommande de conserver les logs d'archive pendant au moins 48 heures. Le connecteur nécessite également une journalisation supplémentaire afin que LogMiner émette les valeurs de colonne nécessaires pour reconstruire chaque changement.

Variantes de base de données

Le connecteur prend en charge les déploiements Oracle suivants :

  • Bases de données à tenant unique (non-CDB).
  • Bases de données multi-tenant (conteneur). Pour une base de données multi-tenant, l'utilisateur de réplication doit être un utilisateur commun dans CDB$ROOT, et la connexion Unity Catalog doit utiliser le nom de service CDB$ROOT. Voir Bases de données multi-tenant (CDB).
  • Amazon RDS pour Oracle (réservé à un tenant unique).

Les versions 12c et supérieures d’Oracle sont prises en charge (12c, 18c, 19c, 21c, 23ai et 26ai).

Le connecteur prend en charge Oracle s'exécutant sur une infrastructure cloud (notamment Amazon RDS for Oracle, Oracle sur des machines virtuelles Amazon EC2 ou Azure, et Oracle Cloud Infrastructure (OCI)) ainsi qu'Oracle on-premise utilisant Azure ExpressRoute, AWS Direct Connect ou un VPN si la bande passante est suffisante.

Méthodes d’authentification

Le connecteur prend en charge l'authentification de base avec un nom d'utilisateur et un mot de passe Oracle.

Ingestion Oracle vs. fédération de query

En plus du connecteur CDC Oracle intégré dans Lakeflow Connect, Databricks propose un connecteur zero-copy dans Lakehouse Federation. Le connecteur zero-copy vous permet de query des données dans Oracle sans les déplacer.