Pular para o conteúdo principal

Ingerir dados do Google Workspace

info

Beta

Este recurso está em Beta. Workspace admins can control access to this recurso from the Previews page. See Gerenciar Databricks previews.

Esta página mostra como criar um pipeline de ingestão de dados do Google Workspace gerenciado usando o Lakeflow Connect.

Requisitos

  • Para criar um pipeline de ingestão, primeiro atenda aos seguintes requisitos:

    • Seu workspace deve estar habilitado para o Unity Catalog.

    • O compute Serverless deve estar habilitado para seu workspace. Consulte Requisitos de compute Serverless.

    • Para criar uma nova conexão, você deve ter os privilégios CREATE CONNECTION no metastore. Consulte Gerenciar privilégios no Unity Catalog.

      If the connector supports UI-based pipeline authoring, an admin can create the connection and the pipeline at the same time by completing os passos on this page. However, if the users who create pipelines use API-based pipeline authoring or are non-admin users, an admin must first create the connection in Catalog Explorer. See Connect to managed ingestion sources.

    • Para usar uma conexão existente, você deve ter os privilégios USE CONNECTION ou ALL PRIVILEGES no objeto de conexão.

    • Você deve ter privilégios USE CATALOG no catálogo de destino.

    • Você deve ter os privilégios USE SCHEMA e CREATE TABLE em um esquema existente ou privilégios CREATE SCHEMA no catálogo de destino.

  • Para fazer a ingestão do Google Workspace, primeiro configure a autenticação no Databricks e crie uma conexão. Consulte Configurar a autenticação para o Google Workspace e Criar uma conexão com o Google Workspace.

Criar um pipeline de ingestão

O conector do Google Workspace ingere 33 tabelas de origem, uma para cada aplicativo de atividade do Google Workspace, sob o esquema de origem default. Para obter detalhes, consulte Tabelas de origem compatíveis.

  1. Na barra lateral do workspace do Databricks, clique em Ingestão de dados .
  2. On the Add data page, under Databricks connectors , click Google Workspace .
  3. Na página Connection do assistente de ingestão, selecione a conexão que armazena suas credenciais do Google Workspace. Se você tiver o privilégio CREATE CONNECTION no metastore, clique em Ícone de mais. Create connection para criar uma conexão com as credenciais de Configurar a autenticação para o Google Workspace.
  4. Clique em Avançar .
  5. On the Ingestion setup page, enter a name for the pipeline.
  6. Selecione um catálogo e um esquema para gravar os logs de eventos. Se você tiver os privilégios USE CATALOG e CREATE SCHEMA no catálogo, clique em Ícone de mais. Criar esquema no menu suspenso para criar um esquema.
  7. Clique em Criar pipeline e continuar .
  8. Na página Source , selecione uma ou mais tabelas de aplicativos de atividades para fazer a ingestão (por exemplo, calendar, chat, admin). A interface do usuário lista 30 aplicativos; para fazer a ingestão de login, groups ou groups_enterprise, use a opção Declarative Automation Bundles ou Databricks notebook .
  9. Clique em Salvar e continuar .
  10. On the Destination page, select a catalog and a schema to load data into. If you have USE CATALOG and CREATE SCHEMA privileges on the catalog, click Ícone de mais. Create schema in the drop-down menu to create a schema.
  11. Clique em Salvar e continuar .
  12. (Optional) On the Schedules and notifications page, click Ícone de mais. Create schedule . Set the frequency to refresh the destination tables.
  13. (Opcional) Clique em Ícone de mais. Adicionar notificação para definir notificações por e-mail para o sucesso ou falha da operação do pipeline e clique em Salvar e executar o pipeline .

Examples

O conector do Google Workspace disponibiliza 33 tabelas no esquema de origem default, uma para cada aplicativo de atividade. Para obter detalhes, consulte Supported source tables.

Tabelas de aplicativos de atividade de ingestão

O arquivo de definição de pipeline a seguir ingere tabelas de atividade do Google Workspace:

YAML
resources:
pipelines:
google_workspace_pipeline:
name: google_workspace_pipeline
catalog: 'main'
target: 'google_workspace_data'
ingestion_definition:
connection_name: google_workspace_connection
objects:
- table:
source_schema: 'default'
source_table: 'calendar'
destination_catalog: 'main'
destination_schema: 'google_workspace_data'
destination_table: 'calendar'
- table:
source_schema: 'default'
source_table: 'chat'
destination_catalog: 'main'
destination_schema: 'google_workspace_data'
destination_table: 'chat'
- table:
source_schema: 'default'
source_table: 'admin'
destination_catalog: 'main'
destination_schema: 'google_workspace_data'
destination_table: 'admin'

Arquivo de definição de job de Declarative Automation Bundles

A seguir, apresenta-se um exemplo de arquivo de definição de job para uso com os Pacotes de Automação Declarativa. O job é executado diariamente.

YAML
resources:
jobs:
google_workspace_job:
name: google_workspace_job
schedule:
quartz_cron_expression: '0 0 0 * * ?'
timezone_id: 'UTC'
tasks:
- task_key: google_workspace_ingestion
pipeline_task:
pipeline_id: ${resources.pipelines.google_workspace_pipeline.id}

Padrões comuns

Para configurações avançadas de pipeline, consulte Padrões comuns para pipelines de ingestão gerenciados.

Passos seguintes

Comece, programe e defina alertas no seu pipeline. Consulte Tarefas comuns de manutenção de pipeline.

Recursos adicionais