Conectores de transmissão
O Databricks Lakeflow Connect possui conectores de streaming totalmente gerenciados para ingestão contínua de dados de barramentos de mensagens e fontes de streaming de eventos em tabelas de streaming. Cada conector gerenciado lida com a autenticação de cada origem, decodificação de mensagens e gerenciamento do ciclo de vida do pipeline por meio de uma configuração declarativa, para que você não precise escrever código Structured Streaming diretamente. Para fontes sem um conector gerenciado, você pode transmitir diretamente usando pipelines de Structured Streaming ou Lakeflow pipelines.
Conectores de transmissão gerenciados
Transmissão de outras fontes
Para fontes de transmissão sem um conector gerenciado, incluindo Amazon Kinesis, Google Pub/Sub e Apache Pulsar, você pode transmitir diretamente com pipelines de Structured Streaming ou Lakeflow. Você também pode ler diretamente do Apache Kafka com o Structured Streaming quando precisar de um controle mais preciso sobre como o Stream é lido e processado do que o conector gerenciado do Kafka oferece, como o tratamento de offsets personalizados ou transformações por lote. Para escolher um conector por origem e nível de personalização do pipeline, consulte Escolher um conector padrão.
Componentes do Conector
Um conector de transmissão tem os seguintes componentes:
Componente | Descrição |
|---|---|
Conexão | Um objeto protegível do Unity Catalog que armazena o endpoint de origem e as credenciais de autenticação para sua origem de transmissão. O conector gerenciado usa esta conexão para autenticar sem exigir credenciais na configuração do pipeline. |
Pipeline de ingestão | Um pipeline que lê continuamente mensagens da fonte de transmissão e grava os resultados em tabelas de transmissão. O pipeline executa em compute serverless. |
Tabelas de destino | As tabelas de transmissão onde o pipeline de ingestão grava os dados. |