Pular para o conteúdo principal

Ingerir dados do Amplitude

info

beta

Esse recurso está em Beta. Os administradores do workspace podem controlar o acesso a esse recurso na página Pré-visualizações optando pela prévia do Lakeflow Connect for Amplitude . Consulte Gerenciar prévias do Databricks.

Esta página mostra como criar um pipeline de ingestão gerenciado do Amplitude usando o Lakeflow Connect.

Requisitos

  • Para criar um pipeline de ingestão, primeiro atenda aos seguintes requisitos:

    • Seu workspace deve estar habilitado para o Unity Catalog.

    • O compute serverless deve estar habilitado para seu workspace. Consulte Requisitos de compute serverless.

    • Para criar uma nova conexão, você deve ter privilégios CREATE CONNECTION no metastore. Consulte Gerenciar privilégios no Unity Catalog.

      Se o conector for compatível com a criação de pipeline baseada na interface do usuário, um administrador poderá criar a conexão e o pipeline ao mesmo tempo, concluindo os passos nesta página. No entanto, se os usuários que criam pipelines usarem a criação de pipeline baseada em API ou forem usuários não administradores, um administrador deverá primeiro criar a conexão no Catalog Explorer. Consulte Conectar-se a fontes de ingestão gerenciadas.

    • Para usar uma conexão existente, você deve ter privilégios USE CONNECTION ou ALL PRIVILEGES no objeto de conexão.

    • Você deve ter privilégios USE CATALOG no catálogo de destino.

    • Você deve ter os privilégios USE SCHEMA e CREATE TABLE em um esquema existente ou privilégios CREATE SCHEMA no catálogo de destino.

  • Para ingerir dados do Amplitude, primeiro configure a autenticação do Databricks e crie uma conexão. Consulte Configurar autenticação para o Amplitude e Criar uma conexão com o Amplitude.

Opções de conector

Defina opções com escopo de tabela no objeto individual no bloco connector_options. Consulte Exemplos para obter informações sobre o uso.

Opção

Escopo

Obrigatório

Aplica-se a

Descrição

start_datetime

Tabela

Não

events

Timestamp do evento mais antigo a ser ingerido na primeira sincronização, no formato yyyy-MM-dd'T'HH:mm:ss'Z'. default to 1970-01-01T00:00:00Z.

request_time_range

Tabela

Não

events

Tamanho de cada janela de exportação, como uma duração ISO-8601. default para PT24H. O mínimo é PT2H.

Opção

Escopo

Obrigatório

Aplica-se a

Descrição

start_datetime

Tabela

Não

events

Timestamp do evento mais antigo a ser ingerido na primeira sincronização, no formato yyyy-MM-dd'T'HH:mm:ss'Z'. default to 1970-01-01T00:00:00Z.

request_time_range

Tabela

Não

events

Tamanho de cada janela de exportação, como uma duração ISO-8601. default para PT24H. O mínimo é PT2H.

Criar um pipeline de ingestão

Para obter a lista de tabelas de origem suportadas, consulte Tabelas de origem suportadas.

  1. Na barra lateral do workspace do Databricks, clique em Ícone de ingestão. Ingestão de dados .
  2. Na página Adicionar dados , em Conectores Databricks , clique em Amplitude .
  3. Na página Conexão do assistente de ingestão, selecione a conexão que armazena suas credenciais do Amplitude. Se você tiver o privilégio CREATE CONNECTION no metastore, clique em Ícone de mais. Criar conexão para criar uma conexão com as credenciais de Configurar autenticação para Amplitude.
  4. Clique em Avançar .
  5. Na página Ingestion setup , insira um nome para o pipeline.
  6. Selecione um catálogo e um esquema para gravar logs de eventos. Se você tiver os privilégios USE CATALOG e CREATE SCHEMA no catálogo, clique em Ícone de mais. Criar esquema no menu suspenso para criar um esquema.
  7. Clique em Criar pipeline e continuar .
  8. Na página Origem , selecione as tabelas para ingestão.
  9. Clique em Salvar e continuar .
  10. Na página Destination , selecione um catálogo e um esquema para carregar os dados. Se você tiver os privilégios USE CATALOG e CREATE SCHEMA no catálogo, clique em Ícone de mais. Create schema no menu suspenso para criar um esquema.
  11. Clique em Salvar e continuar .
  12. (Opcional) Na página Cronogramas e notificações , clique em Ícone de mais. Crie um agendamento . Defina a frequência para refresh das tabelas de destino.
  13. (Opcional) Clique em Ícone de mais. Adicionar notificação para definir notificações por email para sucesso ou falha na operação do pipeline e, em seguida, clique em Salvar e executar pipeline .

Exemplos

O conector do Amplitude disponibiliza quatro tabelas de origem no esquema de origem default. Ingira tabelas individuais ou o esquema inteiro.

nota

Enquanto o conector Amplitude estiver em Beta, faça o pin do pipeline no canal PREVIEW, conforme mostrado nos exemplos. Mantenha o campo channel definido como PREVIEW até que o conector esteja disponível de forma geral.

Ingerir tabelas específicas

Use esta opção para ingerir um subconjunto específico de tabelas ou para personalizar a nomenclatura de destino por tabela. A tabela events aceita o connector_options opcional mostrado abaixo; as outras tabelas não declaram opções por tabela.

O seguinte arquivo de definição de pipeline ingere tabelas individuais do Amplitude:

YAML
resources:
pipelines:
amplitude_pipeline:
name: amplitude_pipeline
catalog: 'main'
target: 'amplitude_data'
channel: PREVIEW
ingestion_definition:
connection_name: amplitude_connection
objects:
- table:
source_schema: 'default'
source_table: 'events'
destination_catalog: 'main'
destination_schema: 'amplitude_data'
destination_table: 'events'
connector_options:
api_source_connector_options:
options:
start_datetime: '<start-datetime>'
request_time_range: '<request-time-range>'
- table:
source_schema: 'default'
source_table: 'events_list'
destination_catalog: 'main'
destination_schema: 'amplitude_data'
destination_table: 'events_list'
- table:
source_schema: 'default'
source_table: 'cohorts'
destination_catalog: 'main'
destination_schema: 'amplitude_data'
destination_table: 'cohorts'
- table:
source_schema: 'default'
source_table: 'annotations'
destination_catalog: 'main'
destination_schema: 'amplitude_data'
destination_table: 'annotations'

Ingerir o esquema inteiro

Use esta opção para ingerir todas as tabelas de origem do Amplitude em um único esquema de destino com uma declaração.

O seguinte arquivo de definição de pipeline ingere todas as tabelas Amplitude suportadas em um esquema de destino:

YAML
resources:
pipelines:
amplitude_pipeline:
name: amplitude_pipeline
catalog: 'main'
target: 'amplitude_data'
channel: PREVIEW
ingestion_definition:
connection_name: amplitude_connection
objects:
- schema:
source_schema: 'default'
destination_catalog: 'main'
destination_schema: 'amplitude_data'

Arquivo de definição de job dos Pacotes de Automação Declarativa

O exemplo a seguir é um arquivo de definição de Job para uso com Pacotes de Automação Declarativa. O Job é executado diariamente.

YAML
resources:
jobs:
amplitude_job:
name: amplitude_job
schedule:
quartz_cron_expression: '0 0 0 * * ?'
timezone_id: 'UTC'
tasks:
- task_key: amplitude_ingestion
pipeline_task:
pipeline_id: ${resources.pipelines.amplitude_pipeline.id}

Padrões comuns

Para configurações avançadas de pipeline, consulte Padrões comuns para pipelines de ingestão gerenciados.

Passos seguintes

Comece, programe e defina alertas em seu pipeline. Consulte Tarefas comuns de manutenção de pipeline.

Outros recursos