O que é LakeFlow Connect?
LakeFlow Connect oferece conectores simples e eficientes para ingerir dados de arquivos locais, aplicativos corporativos populares, bancos de dados, armazenamento em nuvem, barramentos de mensagens e muito mais. Esta página descreve algumas das maneiras pelas quais a LakeFlow Connect pode melhorar o desempenho da ETL. Ele também abrange casos de uso comuns e a variedade de ferramentas de ingestão compatíveis, desde conectores totalmente gerenciados até estruturas totalmente personalizáveis.
Conectores por tipo
O Lakeflow Connect organiza os conectores pelo tipo de fonte da qual você ingere dados. Cada tipo tem um conjunto de conectores e uma visão geral de como eles funcionam:
-
- Conectores de banco de dados
- Ingerir de bancos de dados relacionais como MySQL, PostgreSQL, Oracle e SQL Server usando a captura de dados de alterações (CDC).
-
- Conectores SaaS
- Ingira dados de aplicativos SaaS empresariais como Salesforce, HubSpot, Jira e Workday.
-
- Conectores de arquivo
- Ingira arquivos estruturados e não estruturados do armazenamento de objetos cloud e de serviços de arquivos corporativos, como Google Drive e SharePoint.
-
- Conectores de transmissão
- Ingira continuamente de barramentos de mensagens e fontes de transmissão de eventos, como Apache Kafka e RabbitMQ.
-
- Conectores baseados em query
- Ingerir de bancos de dados consultando a origem diretamente, sem captura de dados de alterações (CDC).
-
- Gravação direta (API Zerobus Ingest)
- Grave registros diretamente em tabelas de transmissão a partir de seu aplicativo usando a API do Zerobus Ingest.
Modelos flexíveis de serviços
LakeFlow Connect oferece uma ampla gama de conectores para aplicativos corporativos, armazenamento em nuvem, bancos de dados, barramentos de mensagens e muito mais. Também oferece a flexibilidade de escolher entre as seguintes opções:
Opção | Descrição |
|---|---|
Um serviço totalmente gerenciado | Conectores prontos para uso que democratizam o acesso aos dados com UIs simples e APIs avançadas. Isso permite que o senhor crie rapidamente um pipeline de ingestão robusto e, ao mesmo tempo, minimize os custos de manutenção de longo prazo. |
Um pipeline personalizado | Se você precisar de mais personalização, poderá usar Lakeflow pipelines ou Structured Streaming. Em última análise, essa versatilidade permite que o Lakeflow Connect atenda às necessidades específicas da sua organização. |
Unificação com as principais ferramentas do Databricks
O Lakeflow Connect usa recursos principais do Databricks para fornecer gestão de dados abrangente. Por exemplo, ele oferece governança usando o Unity Catalog, orquestração usando o Lakeflow Jobs e monitoramento holístico em seus pipelines. Isso ajuda sua organização a gerenciar a segurança, a qualidade e o custo dos dados, ao mesmo tempo em que unifica seus processos de ingestão com suas outras ferramentas de engenharia de dados. O Lakeflow Connect é construído em uma Data + AI Platform aberta, com total flexibilidade para incorporar suas ferramentas de terceiros preferidas. Isso garante uma solução personalizada que se alinha à sua infraestrutura existente e às estratégias de dados futuras.
Ingestão rápida e escalável
LakeFlow Connect usa leituras e gravações incrementais para permitir uma ingestão eficiente. Quando combinado com transformações incrementais downstream, isso pode melhorar significativamente o desempenho do ETL.
Casos de uso comuns
Os clientes ingerem dados para resolver os problemas mais desafiadores de suas organizações. Exemplos de casos de uso incluem o seguinte:
Caso de uso | Descrição |
|---|---|
Medir o desempenho da campanha e a pontuação de leads de clientes | |
Maximizando o ROI com modelos históricos e de previsão | |
Personalizando as experiências de compra de seus clientes | |
Recurso humano centralizado | Apoiando a força de trabalho da sua organização |
Aumento da eficiência de fabricação | |
Criar chatbots para ajudar os usuários a entender políticas, produtos e muito mais |
Camadas da pilha ETL
Alguns conectores operam em um nível da pilha ETL. Por exemplo, o Databricks oferece conectores totalmente gerenciados para aplicativos corporativos como Salesforce e bancos de dados como o SQL Server. Outros conectores operam em uma camada diferente da pilha ETL. Por exemplo, você pode usar conectores padrão em LakeFlow Pipelines para mais opções de personalização. Da mesma forma, você pode escolher seu nível de personalização para transmissão de dados de Apache Kafka, Amazon Kinesis, Google Pub/Sub e Apache Pulsar.
Databricks recomenda começar pela camada mais gerenciada. Se não atender às suas necessidades (por exemplo, se não for compatível com a sua fonte de dados), passe para o próximo nível.
A tabela a seguir descreve as camadas de ingestão do produto:
Camada | Descrição |
|---|---|
LakeFlow Pipelines oferecem uma estrutura declarativa para a criação de pipelines de dados. Defina suas transformações, e os Lakeflow pipelines gerenciam orquestração, monitoramento, qualidade de dados, erros e muito mais. Eles se baseiam no Structured Streaming para transmissão e oferecem suporte à maioria dos recursos do Structured Streaming. Para qualquer recurso de Structured Streaming ainda não disponível nos pipelines do Lakeflow, você pode usar as APIs de Structured Streaming diretamente. | |
Conectores totalmente gerenciados baseiam-se em LakeFlow Pipelines, oferecendo ainda mais automação para as fontes de dados mais populares. Eles ampliam a funcionalidade dos LakeFlow Pipelines para também incluir autenticação específica da fonte, CDC, tratamento de casos extremos, manutenção de API de longo prazo, novas tentativas automatizadas, evolução do esquema automatizada e assim por diante. Portanto, eles oferecem ainda mais automação para quaisquer fontes de dados compatíveis. |
gerenciar conectores
Você pode usar conectores totalmente gerenciados para ingerir dados de aplicativos empresariais e bancos de dados. Consulte conceitos de conectores do Lakeflow Connect para obter uma lista completa de conectores compatíveis.
As interfaces suportadas incluem:
- IU da Databricks
- Pacotes de Automação Declarativa
- APIs da Databricks
- SDKs da Databricks
- CLI do Databricks
conectores comunitários
Os conectores da comunidade estendem o Lakeflow Connect para fontes sem suporte a conectores gerenciados. Eles são de código aberto, criados e mantidos pela comunidade, e não são suportados por SLAs da Databricks. Use um conector que a comunidade já registrou para ingerir dados de uma fonte compatível. Consulte Conectores da comunidade no Lakeflow Connect.
Conectores personalizados
Os conectores personalizados permitem que você crie seu próprio conector para uma fonte que não possui um conector gerenciado. Você cria, testa, implanta e executa um conector personalizado em seu próprio workspace do Databricks, sem registrá-lo na comunidade. Consulte Criar um conector personalizado para o Lakeflow Connect.
Conectores padrão
Além dos conectores gerenciados, a Databricks oferece conectores personalizáveis para armazenamento de objetos em cloud e barramentos de mensagens. Consulte Escolha um conector padrão.
Criar ou modificar uma tabela a partir de um arquivo upload (interface de usuário "Adicionar dados")
Você pode importar arquivos que residem em sua rede local, arquivos enviados para um volume ou arquivos baixados de um local na internet. Consulte Criar ou modificar uma tabela usando uploadde arquivos.
Ingestão de parceiros
Muitas ferramentas de terceiros suportam a ingestão de lotes ou transmissão em Databricks. A Databricks valida várias integrações de terceiros, embora as etapas para configurar o acesso aos sistemas de origem e ingerir dados variem de acordo com a ferramenta. Consulte Parceiros de ingestão para obter uma lista de ferramentas validadas. Alguns parceiros tecnológicos também são apresentados no Databricks Partner Connectque tem uma interface de usuário que simplifica a conexão de ferramentas de terceiros aos dados da lakehouse.
Ingestão DIY
Databricks fornece uma plataforma compute geral. Como resultado, o senhor pode criar seus próprios conectores de ingestão usando qualquer linguagem de programação suportada pela Databricks, como Python ou Java. O senhor também pode importar e usar uma biblioteca de conectores de código aberto popular, como a ferramenta de carregamento de dados, o Airbyte e o Debezium.
Alternativas de ingestão
Databricks recomenda a ingestão para a maioria dos casos de uso porque ela se adapta a grandes volumes de dados, consultas de baixa latência e limites de API de terceiros. A ingestão copia dados de seus sistemas de origem para o Databricks, o que resulta em dados duplicados que podem se tornar obsoletos com o tempo. Se não quiser copiar dados, você pode usar as seguintes ferramentas:
Ferramenta | Descrição |
|---|---|
Federação lakehouse | Permite que o senhor consulte fontes de dados externas sem mover seus dados. |
Compartilhamento aberto | Permite que você compartilhe dados com segurança entre plataformas, nuvens e regiões. |