Conectores de arquivo
O Databricks Lakeflow Connect possui conectores para ingerir arquivos do armazenamento de objetos em cloud e serviços de armazenamento de arquivos corporativos. Escolha conectores gerenciados para um serviço de ingestão baseado em configuração, ou conectores padrão baseados em Spark e APIs SQL para uma gama mais ampla de fontes de arquivos e um controle mais refinado.
Conectores de arquivo gerenciados
Os conectores de arquivos gerenciados lidam com a autenticação para cada fonte, leituras incrementais e novas tentativas automatizadas para você:
-
- Google Drive
- Ingerir arquivos do Google Drive no Lakehouse usando ingestão gerenciada de fonte de arquivo.
-
- Microsoft SharePoint
- Ingerir arquivos de sites do Microsoft SharePoint usando ingestão gerenciada de fonte de arquivo.
Conectores de arquivo padrão
Os conectores de arquivo padrão usam APIs Spark e SQL, oferecendo mais controle sobre como os arquivos são lidos e processados:
-
- Armazenamento de objetos na cloud
- Ingira arquivos do S3, ADLS ou GCS usando o Auto Loader ou
COPY INTO.
-
- Servidores SFTP
- Ingerir arquivos de servidores SFTP.
-
- Google Drive
- Ingira arquivos do Google Drive usando as APIs de leitura do Spark.
-
- SharePoint
- Ingerir arquivos do SharePoint usando APIs de leitor do Spark.
Componentes do conector
Um conector de origem de arquivo tem os seguintes componentes:
Componente | Descrição |
|---|---|
Conexão | Um objeto protegível do Unity Catalog que armazena detalhes de autenticação para o serviço de armazenamento de arquivos. |
Pipeline de ingestão | Um pipeline que copia arquivos da origem para as tabelas de destino. O pipeline de ingestão é executado em compute serverless. |
Tabelas de destino | As tabelas onde o pipeline de ingestão grava os dados. Estas são tabelas de transmissão, que são tabelas Delta com suporte extra para o processamento incremental de dados. |