Pular para o conteúdo principal

O que é LakeFlow Connect?

LakeFlow Connect oferece conectores simples e eficientes para ingerir dados de arquivos locais, aplicativos corporativos populares, bancos de dados, armazenamento em nuvem, barramentos de mensagens e muito mais. Esta página descreve algumas das maneiras pelas quais a LakeFlow Connect pode melhorar o desempenho da ETL. Ele também abrange casos de uso comuns e a variedade de ferramentas de ingestão compatíveis, desde conectores totalmente gerenciados até estruturas totalmente personalizáveis.

Conectores por tipo

O Lakeflow Connect organiza os conectores pelo tipo de fonte da qual você ingere dados. Cada tipo tem um conjunto de conectores e uma visão geral de como eles funcionam:

    • Conectores de banco de dados
    • Ingerir de bancos de dados relacionais como MySQL, PostgreSQL, Oracle e SQL Server usando a captura de dados de alterações (CDC).
    • Conectores SaaS
    • Ingira dados de aplicativos SaaS empresariais como Salesforce, HubSpot, Jira e Workday.
    • Conectores de arquivo
    • Ingira arquivos estruturados e não estruturados do armazenamento de objetos cloud e de serviços de arquivos corporativos, como Google Drive e SharePoint.
    • Conectores de transmissão
    • Ingira continuamente de barramentos de mensagens e fontes de transmissão de eventos, como Apache Kafka e RabbitMQ.

Modelos flexíveis de serviços

LakeFlow Connect oferece uma ampla gama de conectores para aplicativos corporativos, armazenamento em nuvem, bancos de dados, barramentos de mensagens e muito mais. Também oferece a flexibilidade de escolher entre as seguintes opções:

Opção

Descrição

Um serviço totalmente gerenciado

Conectores prontos para uso que democratizam o acesso aos dados com UIs simples e APIs avançadas. Isso permite que o senhor crie rapidamente um pipeline de ingestão robusto e, ao mesmo tempo, minimize os custos de manutenção de longo prazo.

Um pipeline personalizado

Se você precisar de mais personalização, poderá usar Lakeflow pipelines ou Structured Streaming. Em última análise, essa versatilidade permite que o Lakeflow Connect atenda às necessidades específicas da sua organização.

Opção

Descrição

Um serviço totalmente gerenciado

Conectores prontos para uso que democratizam o acesso aos dados com UIs simples e APIs avançadas. Isso permite que o senhor crie rapidamente um pipeline de ingestão robusto e, ao mesmo tempo, minimize os custos de manutenção de longo prazo.

Um pipeline personalizado

Se você precisar de mais personalização, poderá usar Lakeflow pipelines ou Structured Streaming. Em última análise, essa versatilidade permite que o Lakeflow Connect atenda às necessidades específicas da sua organização.

Unificação com as principais ferramentas do Databricks

O Lakeflow Connect usa recursos principais do Databricks para fornecer gestão de dados abrangente. Por exemplo, ele oferece governança usando o Unity Catalog, orquestração usando o Lakeflow Jobs e monitoramento holístico em seus pipelines. Isso ajuda sua organização a gerenciar a segurança, a qualidade e o custo dos dados, ao mesmo tempo em que unifica seus processos de ingestão com suas outras ferramentas de engenharia de dados. O Lakeflow Connect é construído em uma Data + AI Platform aberta, com total flexibilidade para incorporar suas ferramentas de terceiros preferidas. Isso garante uma solução personalizada que se alinha à sua infraestrutura existente e às estratégias de dados futuras.

Ingestão rápida e escalável

LakeFlow Connect usa leituras e gravações incrementais para permitir uma ingestão eficiente. Quando combinado com transformações incrementais downstream, isso pode melhorar significativamente o desempenho do ETL.

Casos de uso comuns

Os clientes ingerem dados para resolver os problemas mais desafiadores de suas organizações. Exemplos de casos de uso incluem o seguinte:

Caso de uso

Descrição

Cliente 360

Medir o desempenho da campanha e a pontuação de leads de clientes

Gerenciamento de portfólio

Maximizando o ROI com modelos históricos e de previsão

Análise do consumidor

Personalizando as experiências de compra de seus clientes

Recurso humano centralizado

Apoiando a força de trabalho da sua organização

gêmeos digitais

Aumento da eficiência de fabricação

Chatbots RAG

Criar chatbots para ajudar os usuários a entender políticas, produtos e muito mais

Caso de uso

Descrição

Cliente 360

Medir o desempenho da campanha e a pontuação de leads de clientes

Gerenciamento de portfólio

Maximizando o ROI com modelos históricos e de previsão

Análise do consumidor

Personalizando as experiências de compra de seus clientes

Recurso humano centralizado

Apoiando a força de trabalho da sua organização

gêmeos digitais

Aumento da eficiência de fabricação

Chatbots RAG

Criar chatbots para ajudar os usuários a entender políticas, produtos e muito mais

Camadas da pilha ETL

Alguns conectores operam em um nível da pilha ETL. Por exemplo, o Databricks oferece conectores totalmente gerenciados para aplicativos corporativos como Salesforce e bancos de dados como o SQL Server. Outros conectores operam em uma camada diferente da pilha ETL. Por exemplo, você pode usar conectores padrão em LakeFlow Pipelines para mais opções de personalização. Da mesma forma, você pode escolher seu nível de personalização para transmissão de dados de Apache Kafka, Amazon Kinesis, Google Pub/Sub e Apache Pulsar.

Databricks recomenda começar pela camada mais gerenciada. Se não atender às suas necessidades (por exemplo, se não for compatível com a sua fonte de dados), passe para o próximo nível.

A tabela a seguir descreve as camadas de ingestão do produto:

Camada

Descrição

LakeFlow Pipelines

LakeFlow Pipelines oferecem uma estrutura declarativa para a criação de pipelines de dados. Defina suas transformações, e os Lakeflow pipelines gerenciam orquestração, monitoramento, qualidade de dados, erros e muito mais. Eles se baseiam no Structured Streaming para transmissão e oferecem suporte à maioria dos recursos do Structured Streaming. Para qualquer recurso de Structured Streaming ainda não disponível nos pipelines do Lakeflow, você pode usar as APIs de Structured Streaming diretamente.

conectores totalmente gerenciados

Conectores totalmente gerenciados baseiam-se em LakeFlow Pipelines, oferecendo ainda mais automação para as fontes de dados mais populares. Eles ampliam a funcionalidade dos LakeFlow Pipelines para também incluir autenticação específica da fonte, CDC, tratamento de casos extremos, manutenção de API de longo prazo, novas tentativas automatizadas, evolução do esquema automatizada e assim por diante. Portanto, eles oferecem ainda mais automação para quaisquer fontes de dados compatíveis.

Camada

Descrição

LakeFlow Pipelines

LakeFlow Pipelines oferecem uma estrutura declarativa para a criação de pipelines de dados. Defina suas transformações, e os Lakeflow pipelines gerenciam orquestração, monitoramento, qualidade de dados, erros e muito mais. Eles se baseiam no Structured Streaming para transmissão e oferecem suporte à maioria dos recursos do Structured Streaming. Para qualquer recurso de Structured Streaming ainda não disponível nos pipelines do Lakeflow, você pode usar as APIs de Structured Streaming diretamente.

conectores totalmente gerenciados

Conectores totalmente gerenciados baseiam-se em LakeFlow Pipelines, oferecendo ainda mais automação para as fontes de dados mais populares. Eles ampliam a funcionalidade dos LakeFlow Pipelines para também incluir autenticação específica da fonte, CDC, tratamento de casos extremos, manutenção de API de longo prazo, novas tentativas automatizadas, evolução do esquema automatizada e assim por diante. Portanto, eles oferecem ainda mais automação para quaisquer fontes de dados compatíveis.

gerenciar conectores

Você pode usar conectores totalmente gerenciados para ingerir dados de aplicativos empresariais e bancos de dados. Consulte conceitos de conectores do Lakeflow Connect para obter uma lista completa de conectores compatíveis.

As interfaces suportadas incluem:

  • IU da Databricks
  • Pacotes de Automação Declarativa
  • APIs da Databricks
  • SDKs da Databricks
  • CLI do Databricks

conectores comunitários

Os conectores da comunidade estendem o Lakeflow Connect para fontes sem suporte a conectores gerenciados. Eles são de código aberto, criados e mantidos pela comunidade, e não são suportados por SLAs da Databricks. Use um conector que a comunidade já registrou para ingerir dados de uma fonte compatível. Consulte Conectores da comunidade no Lakeflow Connect.

Conectores personalizados

Os conectores personalizados permitem que você crie seu próprio conector para uma fonte que não possui um conector gerenciado. Você cria, testa, implanta e executa um conector personalizado em seu próprio workspace do Databricks, sem registrá-lo na comunidade. Consulte Criar um conector personalizado para o Lakeflow Connect.

Conectores padrão

Além dos conectores gerenciados, a Databricks oferece conectores personalizáveis para armazenamento de objetos em cloud e barramentos de mensagens. Consulte Escolha um conector padrão.

Criar ou modificar uma tabela a partir de um arquivo upload (interface de usuário "Adicionar dados")

Você pode importar arquivos que residem em sua rede local, arquivos enviados para um volume ou arquivos baixados de um local na internet. Consulte Criar ou modificar uma tabela usando uploadde arquivos.

Ingestão de parceiros

Muitas ferramentas de terceiros suportam a ingestão de lotes ou transmissão em Databricks. A Databricks valida várias integrações de terceiros, embora as etapas para configurar o acesso aos sistemas de origem e ingerir dados variem de acordo com a ferramenta. Consulte Parceiros de ingestão para obter uma lista de ferramentas validadas. Alguns parceiros tecnológicos também são apresentados no Databricks Partner Connectque tem uma interface de usuário que simplifica a conexão de ferramentas de terceiros aos dados da lakehouse.

Ingestão DIY

Databricks fornece uma plataforma compute geral. Como resultado, o senhor pode criar seus próprios conectores de ingestão usando qualquer linguagem de programação suportada pela Databricks, como Python ou Java. O senhor também pode importar e usar uma biblioteca de conectores de código aberto popular, como a ferramenta de carregamento de dados, o Airbyte e o Debezium.

Alternativas de ingestão

Databricks recomenda a ingestão para a maioria dos casos de uso porque ela se adapta a grandes volumes de dados, consultas de baixa latência e limites de API de terceiros. A ingestão copia dados de seus sistemas de origem para o Databricks, o que resulta em dados duplicados que podem se tornar obsoletos com o tempo. Se não quiser copiar dados, você pode usar as seguintes ferramentas:

Ferramenta

Descrição

Federação lakehouse

Permite que o senhor consulte fontes de dados externas sem mover seus dados.

Compartilhamento aberto

Permite que você compartilhe dados com segurança entre plataformas, nuvens e regiões.

Ferramenta

Descrição

Federação lakehouse

Permite que o senhor consulte fontes de dados externas sem mover seus dados.

Compartilhamento aberto

Permite que você compartilhe dados com segurança entre plataformas, nuvens e regiões.