Ingerir dados do Amplitude
beta
Esse recurso está em Beta. Os administradores do workspace podem controlar o acesso a esse recurso na página Pré-visualizações optando pela prévia do Lakeflow Connect for Amplitude . Consulte Gerenciar prévias do Databricks.
Esta página mostra como criar um pipeline de ingestão gerenciado do Amplitude usando o Lakeflow Connect.
Requisitos
-
Para criar um pipeline de ingestão, primeiro atenda aos seguintes requisitos:
-
Seu workspace deve estar habilitado para o Unity Catalog.
-
O compute serverless deve estar habilitado para seu workspace. Consulte Requisitos de compute serverless.
-
Para criar uma nova conexão, você deve ter privilégios
CREATE CONNECTIONno metastore. Consulte Gerenciar privilégios no Unity Catalog.Se o conector for compatível com a criação de pipeline baseada na interface do usuário, um administrador poderá criar a conexão e o pipeline ao mesmo tempo, concluindo os passos nesta página. No entanto, se os usuários que criam pipelines usarem a criação de pipeline baseada em API ou forem usuários não administradores, um administrador deverá primeiro criar a conexão no Catalog Explorer. Consulte Conectar-se a fontes de ingestão gerenciadas.
-
Para usar uma conexão existente, você deve ter privilégios
USE CONNECTIONouALL PRIVILEGESno objeto de conexão. -
Você deve ter privilégios
USE CATALOGno catálogo de destino. -
Você deve ter os privilégios
USE SCHEMAeCREATE TABLEem um esquema existente ou privilégiosCREATE SCHEMAno catálogo de destino.
-
-
Para ingerir dados do Amplitude, primeiro configure a autenticação do Databricks e crie uma conexão. Consulte Configurar autenticação para o Amplitude e Criar uma conexão com o Amplitude.
Opções de conector
Defina opções com escopo de tabela no objeto individual no bloco connector_options. Consulte Exemplos para obter informações sobre o uso.
Opção | Escopo | Obrigatório | Aplica-se a | Descrição |
|---|---|---|---|---|
| Tabela | Não |
| Timestamp do evento mais antigo a ser ingerido na primeira sincronização, no formato |
| Tabela | Não |
| Tamanho de cada janela de exportação, como uma duração ISO-8601. default para |
Criar um pipeline de ingestão
Para obter a lista de tabelas de origem suportadas, consulte Tabelas de origem suportadas.
- Databricks UI
- Declarative Automation Bundles
- Databricks notebook
- Na barra lateral do workspace do Databricks, clique em
Ingestão de dados .
- Na página Adicionar dados , em Conectores Databricks , clique em Amplitude .
- Na página Conexão do assistente de ingestão, selecione a conexão que armazena suas credenciais do Amplitude. Se você tiver o privilégio
CREATE CONNECTIONno metastore, clique emCriar conexão para criar uma conexão com as credenciais de Configurar autenticação para Amplitude.
- Clique em Avançar .
- Na página Ingestion setup , insira um nome para o pipeline.
- Selecione um catálogo e um esquema para gravar logs de eventos. Se você tiver os privilégios
USE CATALOGeCREATE SCHEMAno catálogo, clique emCriar esquema no menu suspenso para criar um esquema.
- Clique em Criar pipeline e continuar .
- Na página Origem , selecione as tabelas para ingestão.
- Clique em Salvar e continuar .
- Na página Destination , selecione um catálogo e um esquema para carregar os dados. Se você tiver os privilégios
USE CATALOGeCREATE SCHEMAno catálogo, clique emCreate schema no menu suspenso para criar um esquema.
- Clique em Salvar e continuar .
- (Opcional) Na página Cronogramas e notificações , clique em
Crie um agendamento . Defina a frequência para refresh das tabelas de destino.
- (Opcional) Clique em
Adicionar notificação para definir notificações por email para sucesso ou falha na operação do pipeline e, em seguida, clique em Salvar e executar pipeline .
Use os Pacotes de Automação Declarativa para gerenciar pipelines do Amplitude como código. Os pacotes podem conter definições YAML de Jobs e tarefas, são gerenciados usando a CLI do Databricks e podem ser compartilhados e ter execução em diferentes workspaces de destino (como desenvolvimento, staging e produção). Para obter mais informações, consulte O que são os Pacotes de Automação Declarativa?.
-
Crie um pacote usando a CLI do Databricks:
Bashdatabricks bundle init -
Adicione dois novos arquivos de recurso ao pacote:
- Um arquivo de definição de pipeline (por exemplo,
resources/amplitude_pipeline.yml). Consulte pipeline.ingestion_definition e Exemplos. - Um arquivo de definição de job que controla a frequência da ingestão de dados (por exemplo,
resources/amplitude_job.yml).
- Um arquivo de definição de pipeline (por exemplo,
-
Implantar o pipeline usando a CLI do Databricks:
Bashdatabricks bundle deploy
- Importe o seguinte notebook para o seu workspace do Databricks:
-
Deixe as células um e dois como estão. Não modifique.
-
Modifique a célula três com os detalhes de configuração do seu pipeline. Veja pipeline.ingestion_definition e Exemplos.
-
Opcionalmente, configure as definições avançadas do pipeline. Consulte Padrões comuns para pipelines de ingestão gerenciados.
-
Clique em Executar tudo .
Exemplos
O conector do Amplitude disponibiliza quatro tabelas de origem no esquema de origem default. Ingira tabelas individuais ou o esquema inteiro.
Enquanto o conector Amplitude estiver em Beta, faça o pin do pipeline no canal PREVIEW, conforme mostrado nos exemplos. Mantenha o campo channel definido como PREVIEW até que o conector esteja disponível de forma geral.
Ingerir tabelas específicas
Use esta opção para ingerir um subconjunto específico de tabelas ou para personalizar a nomenclatura de destino por tabela. A tabela events aceita o connector_options opcional mostrado abaixo; as outras tabelas não declaram opções por tabela.
- Declarative Automation Bundles
- Databricks notebook
O seguinte arquivo de definição de pipeline ingere tabelas individuais do Amplitude:
resources:
pipelines:
amplitude_pipeline:
name: amplitude_pipeline
catalog: 'main'
target: 'amplitude_data'
channel: PREVIEW
ingestion_definition:
connection_name: amplitude_connection
objects:
- table:
source_schema: 'default'
source_table: 'events'
destination_catalog: 'main'
destination_schema: 'amplitude_data'
destination_table: 'events'
connector_options:
api_source_connector_options:
options:
start_datetime: '<start-datetime>'
request_time_range: '<request-time-range>'
- table:
source_schema: 'default'
source_table: 'events_list'
destination_catalog: 'main'
destination_schema: 'amplitude_data'
destination_table: 'events_list'
- table:
source_schema: 'default'
source_table: 'cohorts'
destination_catalog: 'main'
destination_schema: 'amplitude_data'
destination_table: 'cohorts'
- table:
source_schema: 'default'
source_table: 'annotations'
destination_catalog: 'main'
destination_schema: 'amplitude_data'
destination_table: 'annotations'
A seguinte especificação de pipeline ingere tabelas individuais do Amplitude:
pipeline_name = "amplitude_pipeline"
connection_name = "<amplitude-connection>"
pipeline_spec = {
"name": pipeline_name,
"catalog": "main",
"schema": "amplitude_data",
"ingestion_definition": {
"connection_name": connection_name,
"objects": [
{
"table": {
"source_schema": "default",
"source_table": "events",
"destination_catalog": "main",
"destination_schema": "amplitude_data",
"destination_table": "events",
"connector_options": {
"api_source_connector_options": {
"options": {
"start_datetime": "<start-datetime>",
"request_time_range": "<request-time-range>"
}
}
}
}
},
{
"table": {
"source_schema": "default",
"source_table": "events_list",
"destination_catalog": "main",
"destination_schema": "amplitude_data",
"destination_table": "events_list"
}
},
{
"table": {
"source_schema": "default",
"source_table": "cohorts",
"destination_catalog": "main",
"destination_schema": "amplitude_data",
"destination_table": "cohorts"
}
},
{
"table": {
"source_schema": "default",
"source_table": "annotations",
"destination_catalog": "main",
"destination_schema": "amplitude_data",
"destination_table": "annotations"
}
}
]
},
"channel": "PREVIEW"
}
json_payload = json.dumps(pipeline_spec, indent=2)
create_pipeline(json_payload)
Ingerir o esquema inteiro
Use esta opção para ingerir todas as tabelas de origem do Amplitude em um único esquema de destino com uma declaração.
- Declarative Automation Bundles
- Databricks notebook
O seguinte arquivo de definição de pipeline ingere todas as tabelas Amplitude suportadas em um esquema de destino:
resources:
pipelines:
amplitude_pipeline:
name: amplitude_pipeline
catalog: 'main'
target: 'amplitude_data'
channel: PREVIEW
ingestion_definition:
connection_name: amplitude_connection
objects:
- schema:
source_schema: 'default'
destination_catalog: 'main'
destination_schema: 'amplitude_data'
A especificação de pipeline a seguir ingere todas as tabelas do Amplitude com suporte em um esquema de destino:
pipeline_name = "amplitude_pipeline"
connection_name = "<amplitude-connection>"
pipeline_spec = {
"name": pipeline_name,
"catalog": "main",
"schema": "amplitude_data",
"ingestion_definition": {
"connection_name": connection_name,
"objects": [
{
"schema": {
"source_schema": "default",
"destination_catalog": "main",
"destination_schema": "amplitude_data"
}
}
]
},
"channel": "PREVIEW"
}
json_payload = json.dumps(pipeline_spec, indent=2)
create_pipeline(json_payload)
Arquivo de definição de job dos Pacotes de Automação Declarativa
O exemplo a seguir é um arquivo de definição de Job para uso com Pacotes de Automação Declarativa. O Job é executado diariamente.
- Declarative Automation Bundles
resources:
jobs:
amplitude_job:
name: amplitude_job
schedule:
quartz_cron_expression: '0 0 0 * * ?'
timezone_id: 'UTC'
tasks:
- task_key: amplitude_ingestion
pipeline_task:
pipeline_id: ${resources.pipelines.amplitude_pipeline.id}
Padrões comuns
Para configurações avançadas de pipeline, consulte Padrões comuns para pipelines de ingestão gerenciados.
Passos seguintes
Comece, programe e defina alertas em seu pipeline. Consulte Tarefas comuns de manutenção de pipeline.