Pular para o conteúdo principal

Conectores de arquivo

O Databricks Lakeflow Connect possui conectores para ingerir arquivos do armazenamento de objetos em cloud e serviços de armazenamento de arquivos corporativos. Escolha conectores gerenciados para um serviço de ingestão baseado em configuração, ou conectores padrão baseados em Spark e APIs SQL para uma gama mais ampla de fontes de arquivos e um controle mais refinado.

Conectores de arquivo gerenciados

Os conectores de arquivos gerenciados lidam com a autenticação para cada fonte, leituras incrementais e novas tentativas automatizadas para você:

    • Google Drive
    • Ingerir arquivos do Google Drive no Lakehouse usando ingestão gerenciada de fonte de arquivo.
    • Microsoft SharePoint
    • Ingerir arquivos de sites do Microsoft SharePoint usando ingestão gerenciada de fonte de arquivo.

Conectores de arquivo padrão

Os conectores de arquivo padrão usam APIs Spark e SQL, oferecendo mais controle sobre como os arquivos são lidos e processados:

Componentes do conector

Um conector de origem de arquivo tem os seguintes componentes:

Componente

Descrição

Conexão

Um objeto protegível do Unity Catalog que armazena detalhes de autenticação para o serviço de armazenamento de arquivos.

Pipeline de ingestão

Um pipeline que copia arquivos da origem para as tabelas de destino. O pipeline de ingestão é executado em compute serverless.

Tabelas de destino

As tabelas onde o pipeline de ingestão grava os dados. Estas são tabelas de transmissão, que são tabelas Delta com suporte extra para o processamento incremental de dados.

Componente

Descrição

Conexão

Um objeto protegível do Unity Catalog que armazena detalhes de autenticação para o serviço de armazenamento de arquivos.

Pipeline de ingestão

Um pipeline que copia arquivos da origem para as tabelas de destino. O pipeline de ingestão é executado em compute serverless.

Tabelas de destino

As tabelas onde o pipeline de ingestão grava os dados. Estas são tabelas de transmissão, que são tabelas Delta com suporte extra para o processamento incremental de dados.