Pular para o conteúdo principal

Ingerir dados do Google Drive

Crie um pipeline de ingestão gerenciado do Google Drive no Lakeflow Connect usando a interface do usuário do Databricks, os Pacotes de Automação Declarativa ou um Notebook. O pipeline ingere arquivos do Google Drive em tabelas Delta e as mantém sincronizadas com a origem.

Antes de começar

  • Para criar o pipeline de ingestão, você deve primeiro atender aos seguintes requisitos:

    • Seu workspace deve estar habilitado para o Unity Catalog.

    • O compute serverless deve ser habilitado para seu workspace. Consulte Requisitos de computação serverless.

    • Para criar uma nova conexão, você deve ter os privilégios CREATE CONNECTION no metastore. Consulte Gerenciar privilégios no Unity Catalog.

      Se o conector suportar a criação de pipelines baseada na IU, um administrador poderá criar a conexão e o pipeline simultaneamente, ao concluir os passos nesta página. No entanto, se os usuários que criam pipelines usam a autoria de pipeline baseada em API ou são usuários não administradores, um administrador deve primeiro criar a conexão no Catalog Explorer. Consulte Conectar-se a fontes de ingestão gerenciadas.

    • Para usar uma conexão existente, você deve ter os privilégios USE CONNECTION ou ALL PRIVILEGES no objeto de conexão.

    • Você deve ter privilégios USE CATALOG no catálogo de destino.

    • É necessário ter os privilégios USE SCHEMA e CREATE TABLE em um esquema existente ou os privilégios CREATE SCHEMA no catálogo de destino.

  • Crie uma conexão do Unity Catalog. Consulte Visão geral da configuração de ingestão do Google Drive.

Criar pipeline de ingestão

Para uma lista de formatos de arquivo compatíveis e limitações específicas do conector, consulte limitações do conector do Google Drive.

  1. Na barra lateral do workspace do Databricks, clique em Ingestão de dados .

  2. Na página Add data , na seção Databricks connectors , clique em Google Drive .

  3. Na etapa Conexão do assistente de ingestão, selecione a conexão que armazena suas credenciais de acesso ao Google Drive.

  4. Clique em Avançar .

  5. No passo Ingestion setup , insira um nome para o pipeline.

  6. Selecione um catálogo e um esquema para salvar o pipeline.

  7. Clique em Criar pipeline de ingestão e começar o compute .

  8. N' o passo Source, insira o URL de cada pasta, drive ou drive compartilhado do Google Drive de onde deseja fazer a ingestão e, em seguida, configure as opções de ingestão de arquivos.

  9. Click Save and continue .

  10. Na etapa Destination , selecione um catálogo e um esquema para carregar os dados. Se você tiver os privilégios USE CATALOG e CREATE SCHEMA no catálogo, clique em Ícone de mais. Create schema no menu suspenso para criar um novo esquema.

  11. Click Save and continue .

  12. (Opcional) No passo Schedules and notifications , clique em Ícone de mais. Create schedule . Defina a frequência para refresh das tabelas de destino.

  13. (Opcional) Clique em Ícone de mais. Adicionar notificação para definir notificações por email para o sucesso ou a falha da operação do pipeline.

  14. Click Save and execução pipeline .

Exemplos

Use estes exemplos para configurar o pipeline.

Ingerir arquivos como dados não estruturados

Ingerir todos os arquivos de uma pasta do Google Drive como conteúdo binário. Adote esta abordagem para PDFs, documentos do Office e outros arquivos que se pretende processar posteriormente, por exemplo, para aplicativos RAG.

nota

Disponível em Beta, o tipo FILE armazena uma referência governada para cada arquivo e seus metadados em vez dos bytes do arquivo, o que melhora o desempenho de leitura. Para ingerir arquivos como o tipo FILE em vez de BINARYFILE, consulte Ingerir arquivos como o tipo FILE (Beta).

YAML
resources:
pipelines:
gdrive_binary_pipeline:
name: gdrive_binary_pipeline
catalog: main
schema: ingest_destination_schema
channel: PREVIEW
ingestion_definition:
connection_name: <gdrive-connection>
objects:
- table:
destination_catalog: main
destination_schema: ingest_destination_schema
destination_table: drive_folder
connector_options:
gdrive_options:
entity_type: FILE
url: https://drive.google.com/drive/folders/<folder_id>
file_ingestion_options:
format: BINARYFILE
schema_evolution_mode: NONE

Ingerir arquivos como o tipo FILE (Beta)

info

Beta

Este recurso está em Beta. Os administradores do espaço de trabalho podem controlar o acesso a esse recurso na página Pré-visualizações . Consulte Gerenciar prévias do Databricks.

Ingira arquivos como o tipo FILE para armazenar uma referência governada para cada arquivo e seus metadados em vez dos bytes do arquivo. A tabela de destino expõe uma coluna file que você pode passar para funções como ai_parse_document function e para funções definidas pelo usuário (UDFs).

Para usar o tipo FILE, configure o seguinte em seu pipeline:

  • Defina o pipeline channel como PREVIEW.
  • Defina file_ingestion_options.format como FILE.
  • Defina a propriedade de tabela databricks.filespace-preview para declarar o volume que o Unity Catalog usa como armazenamento gerenciado.
YAML
resources:
pipelines:
gdrive_file_pipeline:
name: gdrive_file_pipeline
channel: PREVIEW
catalog: <catalog>
schema: <schema>
ingestion_definition:
connection_name: <gdrive-connection>
objects:
- table:
destination_catalog: <catalog>
destination_schema: <schema>
destination_table: <destination-table>
table_configuration:
table_properties:
databricks.filespace-preview: /Volumes/<catalog>/<schema>/<volume>/
connector_options:
gdrive_options:
entity_type: FILE
url: https://drive.google.com/drive/folders/<folder_id>
file_ingestion_options:
format: FILE
schema_evolution_mode: NONE

Ingerir arquivos estruturados com um filtro de caminho

Ingerir arquivos CSV de uma pasta do Google Drive. Use file_filters para restringir a ingestão a arquivos que correspondam a um padrão glob.

YAML
resources:
pipelines:
gdrive_csv_pipeline:
name: gdrive_csv_pipeline
catalog: main
schema: ingest_destination_schema
channel: PREVIEW
ingestion_definition:
connection_name: <gdrive-connection>
objects:
- table:
destination_catalog: main
destination_schema: ingest_destination_schema
destination_table: csv_files
connector_options:
gdrive_options:
entity_type: FILE
url: https://drive.google.com/drive/folders/<folder_id>
file_ingestion_options:
format: CSV
schema_evolution_mode: NONE
file_filters:
- path_filter: '*.csv'

Ingerir somente metadados de arquivo

Ingerir metadados de arquivo (nome, tamanho, carimbos de data e hora, caminho) sem baixar o conteúdo do arquivo. Utilize esta abordagem quando for necessário um inventário de arquivos sem a sobrecarga de ingerir seu conteúdo.

YAML
resources:
pipelines:
gdrive_metadata_pipeline:
name: gdrive_metadata_pipeline
catalog: main
schema: ingest_destination_schema
channel: PREVIEW
ingestion_definition:
connection_name: <gdrive-connection>
objects:
- table:
destination_catalog: main
destination_schema: ingest_destination_schema
destination_table: file_metadata
connector_options:
gdrive_options:
entity_type: FILE_METADATA
url: https://drive.google.com/drive/folders/<folder_id>
file_ingestion_options:
format: BINARYFILE
schema_evolution_mode: NONE

Arquivo de definição de Job de Pacotes de Automação Declarativa

O seguinte é um exemplo de arquivo de definição de job para uso com Pacotes de Automação Declarativa. O Job executa todos os dias, exatamente um dia após a última execução.

YAML
resources:
jobs:
gdrive_job:
name: gdrive_job

trigger:
periodic:
interval: 1
unit: DAYS

email_notifications:
on_failure:
- <email-address>

tasks:
- task_key: refresh_pipeline
pipeline_task:
pipeline_id: ${resources.pipelines.gdrive_binary_pipeline.id}

Configurar opções de ingestão de arquivos

O bloco file_ingestion_options controla como os arquivos são processados. Todas as opções são definidas dentro do bloco gdrive_options.file_ingestion_options na definição do pipeline.

Filtros de arquivos

Utilize file_filters para restringir os arquivos a serem ingeridos do URL de origem:

JSON
"file_ingestion_options": {
"format": "CSV",
"file_filters": [
{ "path_filter": "invoices/*.csv" },
{ "modified_after": "2026-01-01T00:00:00" }
]
}

Para a referência completa do parâmetro file_ingestion_options, consulte Referência do conector do Google Drive.

evolução do esquema

Defina schema_evolution_mode para controlar como as novas colunas em arquivos recebidos são tratadas. Os modos são compatíveis com os modos de evolução do esquema do Auto Loader. Para obter detalhes, consulte a referência do conector do Google Drive.

Dicas de esquema

Substituir tipos de coluna inferidos usando schema_hints:

JSON
"file_ingestion_options": {
"format": "CSV",
"schema_hints": "order_id INT, amount DOUBLE, ts TIMESTAMP"
}

Consulte Substitua a inferência de esquema com dicas de esquema para obter detalhes de uso.

Opções específicas de formato

Passar opções específicas do formato usando format_options:

JSON
"file_ingestion_options": {
"format": "CSV",
"format_options": {
"header": "true",
"sep": ","
}
}

Os parâmetros compatíveis são as opções de formato padrão do Auto Loader. Ver Opções de formato.

Padrões comuns

Para configurações avançadas de pipeline, consulte Padrões comuns para pipelines de ingestão gerenciados.

Passos seguintes

Iniciar, programar e definir alertas no seu pipeline. Veja Tarefas comuns de manutenção de pipelines.

Recursos adicionais