Conectores comunitários no LakeFlow Connect
Beta
Este recurso está em versão Beta. Os administradores do espaço de trabalho podem controlar o acesso a este recurso na página de Pré-visualizações . Veja as prévias do Gerenciador Databricks.
Os conectores da comunidade são conectores de código aberto que estendem o Lakeflow Connect para fontes sem suporte a conectores gerenciados. A comunidade os cria e mantém. Esta página mostra como usar um conector da comunidade para ingerir dados de uma fonte suportada no Databricks.
Para criar seu próprio conector para uma fonte que ainda não é suportada, consulte Build a custom connector. Você pode fazer a execução de um conector personalizado em seu próprio Workspace sem contribuir com ele para a comunidade.
Como funcionam os conectores da comunidade
Os conectores da comunidade são construídos na interface LakeflowConnect, que envolve a API da Fonte de Dados Python do Spark. Cada conector lida com autenticação, descoberta de esquema e leituras incrementais de dados para que você possa criar, configurar e executar um pipeline de ingestão apoiado por LakeFlow Pipelines.
Ao usar um conector da comunidade, Databricks clona o código-fonte do conector de um repositório GitHub para um diretório workspace que você especificar. Em seguida, o pipeline lê o código-fonte do conector em tempo de execução e executa a lógica de ingestão na fonte configurada.
Fontes de apoio
A comunidade adiciona novos conectores regularmente. Para obter a lista mais recente de fontes suportadas, consulte a interface de usuário Adicionar dados ( ingestão de dados ) no seu Workspace do Databricks ou o repositório LakeFlow comunidade Connectors no GitHub.
Requisitos
- Um espaço de trabalho do Databricks com o Unity Catalog habilitado
- Uma conexão para a fonte que você deseja ingerir, ou permissões para criar uma conexão
- Acesso de escrita a um catálogo e esquema para as tabelas ingeridas
Criar um pipeline de ingestão
Para ingerir dados usando um conector da comunidade:
-
Na barra lateral do seu workspace do Databricks, clique em +Novo > Adicionar ou fazer upload de dados , depois selecione a fonte em Conectores da comunidade .
-
Clique em + Criar conexão ou selecione uma conexão existente e, em seguida, clique em Próximo .
-
Para Nome do pipeline , insira um nome para o pipeline.
-
Para Local do log de eventos , insira um nome de catálogo e um nome de esquema. O Databricks armazena o log de eventos do pipeline aqui. As tabelas ingeridas também são gravadas aqui por default.
-
Para Caminho raiz , insira o caminho do seu workspace (por exemplo,
/Workspace/Users/<your-email>/connectors). A Databricks clona e armazena o código-fonte do conector aqui. -
Clique em Criar pipeline .
-
No editor de pipeline, abra
ingest.pye atualize o campo objetos para incluir as tabelas que você deseja ingerir. Por exemplo:Pythonfrom databricks.labs.community_connector.pipeline import ingest
pipeline_spec = {
"connection_name": "my_stripe_connection", # Required: UC connection name
"objects": [
{"table": {"source_table": "charges"}},
{"table": {"source_table": "customers",
"destination_table": "stripe_customers"}},
],
}
ingest(spark, pipeline_spec) -
Execução o pipeline manualmente ou programe-o.
Opções de configuração do pipeline
Você pode configurar as seguintes opções em ingest.py:
Opção | Descrição |
|---|---|
| Obrigatório. O nome da conexão que armazena as credenciais de autenticação para a fonte. |
| Obrigatório. Uma lista de tabelas para ingestão. Cada entrada tem o formato |
| O catálogo onde as tabelas ingeridas são gravadas. Adota como default o catálogo definido durante a criação do pipeline. |
| O esquema onde as tabelas ingeridas são gravadas. Adota como default o esquema definido durante a criação do pipeline. |
| A estratégia de dimensões que mudam lentamente (SCD): |
| Substituir as chaves primárias default de uma tabela. Forneça uma lista de nomes de colunas. |
Considerações
- Os conectores comunitários estão em fase ativa de desenvolvimento. As interfaces e o comportamento estão sujeitos a alterações.
- Databricks não mantém conectores para a comunidade. Eles não são respaldados pelos SLAs da Databricks e não garantem compatibilidade futura.
Enviar feedback
Relate bugs e envie solicitações de recursos no repositório LakeFlow comunidade Connectors .