Pular para o conteúdo principal

Ingerir dados do Google Drive

Crie um pipeline de ingestão gerenciado do Google Drive no Lakeflow Connect usando a interface do usuário do Databricks, os Pacotes de Automação Declarativa ou um Notebook. O pipeline ingere arquivos do Google Drive em tabelas Delta e as mantém sincronizadas com a origem.

Antes de começar​

  • Para criar o pipeline de ingestão, você deve primeiro atender aos seguintes requisitos:

    • Seu workspace deve estar habilitado para o Unity Catalog.

    • O compute serverless deve ser habilitado para seu workspace. Consulte Requisitos de computação serverless.

    • Para criar uma nova conexão, você deve ter os privilégios CREATE CONNECTION no metastore. Consulte Gerenciar privilégios no Unity Catalog.

      Se o conector suportar a criação de pipelines baseada na IU, um administrador poderá criar a conexão e o pipeline simultaneamente, ao concluir os passos nesta página. No entanto, se os usuários que criam pipelines usam a autoria de pipeline baseada em API ou são usuários não administradores, um administrador deve primeiro criar a conexão no Catalog Explorer. Consulte Conectar-se a fontes de ingestão gerenciadas.

    • Para usar uma conexão existente, você deve ter os privilégios USE CONNECTION ou ALL PRIVILEGES no objeto de conexão.

    • Você deve ter privilégios USE CATALOG no catálogo de destino.

    • É necessário ter os privilégios USE SCHEMA e CREATE TABLE em um esquema existente ou os privilégios CREATE SCHEMA no catálogo de destino.

  • Crie uma conexão do Unity Catalog. Consulte Visão geral da configuração de ingestão do Google Drive.

Criar pipeline de ingestão​

Para uma lista de formatos de arquivo compatíveis e limitações específicas do conector, consulte limitações do conector do Google Drive.

  1. Na barra lateral do workspace do Databricks, clique em Ingestão de dados .

  2. Na página Add data , na seção Databricks connectors , clique em Google Drive .

  3. Na etapa Conexão do assistente de ingestão, selecione a conexão que armazena suas credenciais de acesso ao Google Drive.

  4. Clique em Avançar .

  5. No passo Ingestion setup , insira um nome para o pipeline.

  6. Selecione um catálogo e um esquema para salvar o pipeline.

  7. Clique em Criar pipeline de ingestão e começar o compute .

  8. N' o passo Source, insira o URL de cada pasta, drive ou drive compartilhado do Google Drive de onde deseja fazer a ingestão e, em seguida, configure as opções de ingestão de arquivos.

  9. Click Save and continue .

  10. Na etapa Destination , selecione um catálogo e um esquema para carregar os dados. Se você tiver os privilégios USE CATALOG e CREATE SCHEMA no catálogo, clique em Ícone de mais. Create schema no menu suspenso para criar um novo esquema.

  11. Click Save and continue .

  12. (Opcional) No passo Schedules and notifications , clique em Ícone de mais. Create schedule . Defina a frequência para refresh das tabelas de destino.

  13. (Opcional) Clique em Ícone de mais. Adicionar notificação para definir notificações por email para o sucesso ou a falha da operação do pipeline.

  14. Click Save and execução pipeline .

Exemplos​

Use estes exemplos para configurar o pipeline.

Ingerir arquivos como dados não estruturados​

Ingerir todos os arquivos de uma pasta do Google Drive como conteúdo binário. Adote esta abordagem para PDFs, documentos do Office e outros arquivos que se pretende processar posteriormente, por exemplo, para aplicativos RAG.

nota

Disponível em Beta, o tipo FILE armazena uma referência governada para cada arquivo e seus metadados em vez dos bytes do arquivo, o que melhora o desempenho de leitura. Para ingerir arquivos como o tipo FILE em vez de BINARYFILE, consulte Ingerir arquivos como o tipo FILE (Beta).

YAML
resources:
pipelines:
gdrive_binary_pipeline:
name: gdrive_binary_pipeline
catalog: main
schema: ingest_destination_schema
channel: PREVIEW
ingestion_definition:
connection_name: <gdrive-connection>
objects:
- table:
destination_catalog: main
destination_schema: ingest_destination_schema
destination_table: drive_folder
connector_options:
gdrive_options:
entity_type: FILE
url: https://drive.google.com/drive/folders/<folder_id>
file_ingestion_options:
format: BINARYFILE
schema_evolution_mode: NONE

Ingerir arquivos como o tipo FILE (Beta)​

info

Beta

Este recurso está em Beta. Os administradores do espaço de trabalho podem controlar o acesso a esse recurso na página Pré-visualizações . Consulte Gerenciar prévias do Databricks.

Ingira arquivos como o tipo FILE para armazenar uma referência governada para cada arquivo e seus metadados em vez dos bytes do arquivo. A tabela de destino expõe uma coluna file que você pode passar para funções como ai_parse_document function e para funções definidas pelo usuário (UDFs).

Para usar o tipo FILE, configure o seguinte em seu pipeline:

  • Defina o pipeline channel como PREVIEW.
  • Defina file_ingestion_options.format como FILE.
  • Defina a propriedade de tabela databricks.filespace-preview para declarar o volume que o Unity Catalog usa como armazenamento gerenciado.
YAML
resources:
pipelines:
gdrive_file_pipeline:
name: gdrive_file_pipeline
channel: PREVIEW
catalog: <catalog>
schema: <schema>
ingestion_definition:
connection_name: <gdrive-connection>
objects:
- table:
destination_catalog: <catalog>
destination_schema: <schema>
destination_table: <destination-table>
table_configuration:
table_properties:
databricks.filespace-preview: /Volumes/<catalog>/<schema>/<volume>/
connector_options:
gdrive_options:
entity_type: FILE
url: https://drive.google.com/drive/folders/<folder_id>
file_ingestion_options:
format: FILE
schema_evolution_mode: NONE

Ingerir arquivos estruturados com um filtro de caminho​

Ingerir arquivos CSV de uma pasta do Google Drive. Use file_filters para restringir a ingestão a arquivos que correspondam a um padrão glob.

YAML
resources:
pipelines:
gdrive_csv_pipeline:
name: gdrive_csv_pipeline
catalog: main
schema: ingest_destination_schema
channel: PREVIEW
ingestion_definition:
connection_name: <gdrive-connection>
objects:
- table:
destination_catalog: main
destination_schema: ingest_destination_schema
destination_table: csv_files
connector_options:
gdrive_options:
entity_type: FILE
url: https://drive.google.com/drive/folders/<folder_id>
file_ingestion_options:
format: CSV
schema_evolution_mode: NONE
file_filters:
- path_filter: '*.csv'

Ingerir somente metadados de arquivo​

Ingerir metadados de arquivo (nome, tamanho, carimbos de data e hora, caminho) sem baixar o conteúdo do arquivo. Utilize esta abordagem quando for necessário um inventário de arquivos sem a sobrecarga de ingerir seu conteúdo.

YAML
resources:
pipelines:
gdrive_metadata_pipeline:
name: gdrive_metadata_pipeline
catalog: main
schema: ingest_destination_schema
channel: PREVIEW
ingestion_definition:
connection_name: <gdrive-connection>
objects:
- table:
destination_catalog: main
destination_schema: ingest_destination_schema
destination_table: file_metadata
connector_options:
gdrive_options:
entity_type: FILE_METADATA
url: https://drive.google.com/drive/folders/<folder_id>
file_ingestion_options:
format: BINARYFILE
schema_evolution_mode: NONE

Arquivo de definição de Job de Pacotes de Automação Declarativa​

O seguinte é um exemplo de arquivo de definição de job para uso com Pacotes de Automação Declarativa. O Job executa todos os dias, exatamente um dia após a última execução.

YAML
resources:
jobs:
gdrive_job:
name: gdrive_job

trigger:
periodic:
interval: 1
unit: DAYS

email_notifications:
on_failure:
- <email-address>

tasks:
- task_key: refresh_pipeline
pipeline_task:
pipeline_id: ${resources.pipelines.gdrive_binary_pipeline.id}

Configurar opções de ingestão de arquivos​

O bloco file_ingestion_options controla como os arquivos são processados. Todas as opções são definidas dentro do bloco gdrive_options.file_ingestion_options na definição do pipeline.

Filtros de arquivos​

Utilize file_filters para restringir os arquivos a serem ingeridos do URL de origem:

JSON
"file_ingestion_options": {
"format": "CSV",
"file_filters": [
{ "path_filter": "invoices/*.csv" },
{ "modified_after": "2026-01-01T00:00:00" }
]
}

Para a referência completa do parâmetro file_ingestion_options, consulte Referência do conector do Google Drive.

evolução do esquema​

Defina schema_evolution_mode para controlar como as novas colunas em arquivos recebidos são tratadas. Os modos são compatíveis com os modos de evolução do esquema do Auto Loader. Para obter detalhes, consulte a referência do conector do Google Drive.

Dicas de esquema​

Substituir tipos de coluna inferidos usando schema_hints:

JSON
"file_ingestion_options": {
"format": "CSV",
"schema_hints": "order_id INT, amount DOUBLE, ts TIMESTAMP"
}

Consulte Substitua a inferência de esquema com dicas de esquema para obter detalhes de uso.

Opções específicas de formato​

Passar opções específicas do formato usando format_options:

JSON
"file_ingestion_options": {
"format": "CSV",
"format_options": {
"header": "true",
"sep": ","
}
}

Os parâmetros compatíveis são as opções de formato padrão do Auto Loader. Ver Opções de formato.

Padrões comuns​

Para configurações avançadas de pipeline, consulte Padrões comuns para pipelines de ingestão gerenciados.

Passos seguintes​

Iniciar, programar e definir alertas no seu pipeline. Veja Tarefas comuns de manutenção de pipelines.

Recursos adicionais​