Pular para o conteúdo principal

Conectores comunitários no LakeFlow Connect

info

Beta

Este recurso está em versão Beta. Os administradores do espaço de trabalho podem controlar o acesso a este recurso na página de Pré-visualizações . Veja as prévias do Gerenciador Databricks.

Os conectores da comunidade são conectores de código aberto que estendem o Lakeflow Connect para fontes sem suporte a conectores gerenciados. A comunidade os cria e mantém. Esta página mostra como usar um conector da comunidade para ingerir dados de uma fonte suportada no Databricks.

Para criar seu próprio conector para uma fonte que ainda não é suportada, consulte Build a custom connector. Você pode fazer a execução de um conector personalizado em seu próprio Workspace sem contribuir com ele para a comunidade.

Como funcionam os conectores da comunidade

Os conectores da comunidade são construídos na interface LakeflowConnect, que envolve a API da Fonte de Dados Python do Spark. Cada conector lida com autenticação, descoberta de esquema e leituras incrementais de dados para que você possa criar, configurar e executar um pipeline de ingestão apoiado por LakeFlow Pipelines.

Ao usar um conector da comunidade, Databricks clona o código-fonte do conector de um repositório GitHub para um diretório workspace que você especificar. Em seguida, o pipeline lê o código-fonte do conector em tempo de execução e executa a lógica de ingestão na fonte configurada.

Fontes de apoio

A comunidade adiciona novos conectores regularmente. Para obter a lista mais recente de fontes suportadas, consulte a interface de usuário Adicionar dados ( ingestão de dados ) no seu Workspace do Databricks ou o repositório LakeFlow comunidade Connectors no GitHub.

Requisitos

  • Um espaço de trabalho do Databricks com o Unity Catalog habilitado
  • Uma conexão para a fonte que você deseja ingerir, ou permissões para criar uma conexão
  • Acesso de escrita a um catálogo e esquema para as tabelas ingeridas

Criar um pipeline de ingestão

Para ingerir dados usando um conector da comunidade:

  1. Na barra lateral do seu workspace do Databricks, clique em +Novo > Adicionar ou fazer upload de dados , depois selecione a fonte em Conectores da comunidade .

  2. Clique em + Criar conexão ou selecione uma conexão existente e, em seguida, clique em Próximo .

  3. Para Nome do pipeline , insira um nome para o pipeline.

  4. Para Local do log de eventos , insira um nome de catálogo e um nome de esquema. O Databricks armazena o log de eventos do pipeline aqui. As tabelas ingeridas também são gravadas aqui por default.

  5. Para Caminho raiz , insira o caminho do seu workspace (por exemplo, /Workspace/Users/<your-email>/connectors). A Databricks clona e armazena o código-fonte do conector aqui.

  6. Clique em Criar pipeline .

  7. No editor de pipeline, abra ingest.py e atualize o campo objetos para incluir as tabelas que você deseja ingerir. Por exemplo:

    Python
    from databricks.labs.community_connector.pipeline import ingest

    pipeline_spec = {
    "connection_name": "my_stripe_connection", # Required: UC connection name
    "objects": [
    {"table": {"source_table": "charges"}},
    {"table": {"source_table": "customers",
    "destination_table": "stripe_customers"}},
    ],
    }

    ingest(spark, pipeline_spec)
  8. Execução o pipeline manualmente ou programe-o.

Opções de configuração do pipeline

Você pode configurar as seguintes opções em ingest.py:

Opção

Descrição

connection_name

Obrigatório. O nome da conexão que armazena as credenciais de autenticação para a fonte.

objects

Obrigatório. Uma lista de tabelas para ingestão. Cada entrada tem o formato {"table": {"source_table": "..."}}. Você também pode especificar um destination_table opcional dentro do objeto table.

destination_catalog

O catálogo onde as tabelas ingeridas são gravadas. Adota como default o catálogo definido durante a criação do pipeline.

destination_schema

O esquema onde as tabelas ingeridas são gravadas. Adota como default o esquema definido durante a criação do pipeline.

scd_type

A estratégia de dimensões que mudam lentamente (SCD): SCD_TYPE_1, SCD_TYPE_2 ou APPEND_ONLY. O default é SCD_TYPE_1.

primary_keys

Substituir as chaves primárias default de uma tabela. Forneça uma lista de nomes de colunas.

Opção

Descrição

connection_name

Obrigatório. O nome da conexão que armazena as credenciais de autenticação para a fonte.

objects

Obrigatório. Uma lista de tabelas para ingestão. Cada entrada tem o formato {"table": {"source_table": "..."}}. Você também pode especificar um destination_table opcional dentro do objeto table.

destination_catalog

O catálogo onde as tabelas ingeridas são gravadas. Adota como default o catálogo definido durante a criação do pipeline.

destination_schema

O esquema onde as tabelas ingeridas são gravadas. Adota como default o esquema definido durante a criação do pipeline.

scd_type

A estratégia de dimensões que mudam lentamente (SCD): SCD_TYPE_1, SCD_TYPE_2 ou APPEND_ONLY. O default é SCD_TYPE_1.

primary_keys

Substituir as chaves primárias default de uma tabela. Forneça uma lista de nomes de colunas.

Considerações

  • Os conectores comunitários estão em fase ativa de desenvolvimento. As interfaces e o comportamento estão sujeitos a alterações.
  • Databricks não mantém conectores para a comunidade. Eles não são respaldados pelos SLAs da Databricks e não garantem compatibilidade futura.

Enviar feedback

Relate bugs e envie solicitações de recursos no repositório LakeFlow comunidade Connectors .