Conceitos do conector CDC integrado do Oracle
Beta
Este recurso está em Beta. Os administradores do workspace podem controlar o acesso a esse recurso na página Prévias . Consulte Gerenciar prévias do Databricks.
Esta página descreve como o conector CDC integrado do Oracle funciona, incluindo seus conceitos principais.
Como o Databricks se conecta ao Oracle?
O Databricks conecta-se ao Oracle usando uma conexão JDBC. As credenciais são armazenadas com segurança no Unity Catalog e só podem ser recuperadas se o usuário que executa o fluxo de ingestão tiver as permissões apropriadas. O Databricks recomenda a criação de um usuário Oracle separado que seja usado exclusivamente para a ingestão de dados. Se houver esquemas ou tabelas que você não deseja expor a este usuário, você pode usar privilégios integrados do Oracle.
Como o conector extrai dados incrementalmente?
O conector usa o LogMiner do Oracle no modo de transação sem commit para ler alterações tanto dos redo logs online quanto dos archive logs. Na primeira execução de um pipeline, ou após um refresh completo, o conector captura um Snapshot inicial de cada tabela selecionada. Em execuções subsequentes, ele captura alterações incrementais (inserções, atualizações e exclusões) dos logs.
Como o conector lê a partir dos Logs de arquivo, o banco de dados de origem deve estar em execução no modo de log de arquivo e reter os Logs de arquivo por tempo suficiente para que o pipeline os processe. O Databricks recomenda manter os logs de arquivo por pelo menos 48 horas. O conector também requer log suplementar para que o LogMiner emita os valores de coluna necessários para reconstruir cada alteração.
Variações de base de dados
O conector suporta as seguintes implantações do Oracle:
- Bancos de dados de tenant único (não CDB).
- Bancos de dados multi-tenant (container). Para um banco de dados multi-tenant, o usuário de replicação deve ser um usuário comum em
CDB$ROOT, e a conexão do Unity Catalog deve usar o nome de serviçoCDB$ROOT. Consulte Bancos de dados multi-tenant (CDB). - Amazon RDS para Oracle (apenas tenant único).
As versões 12c e acima do Oracle são compatíveis (12c, 18c, 19c, 21c, 23ai e 26ai).
O conector oferece suporte ao Oracle em execução na infraestrutura de cloud (incluindo Amazon RDS para Oracle, Oracle no Amazon EC2 ou máquinas virtuais do Azure e Oracle Cloud Infrastructure (OCI)) e ao Oracle on-premises usando Azure ExpressRoute, AWS Direct Connect ou VPN, se houver largura de banda suficiente disponível.
Métodos de autenticação
O conector suporta autenticação básica com um nome de usuário e senha do Oracle.
Ingestão do Oracle versus federação de query
Além do conector CDC integrado do Oracle no Lakeflow Connect, o Databricks oferece um conector zero-copy no Lakehouse Federation. O conector zero-copy permite que você faça query em dados no Oracle sem movê-los.