Pular para o conteúdo principal

Ingerir dados do Shopify

info

Beta

Esse recurso está na versão Beta. Para usá-lo, o administrador do workspace deve ativar o Lakeflow Connect for Shopify na página Pré-visualizações . Consulte Gerenciar prévias do Databricks.

Esta página mostra como criar um pipeline de ingestão do Shopify gerenciado usando o Lakeflow Connect.

Requisitos

  • Para criar um pipeline de ingestão, primeiro atenda aos seguintes requisitos:

    • Seu workspace deve estar habilitado para o Unity Catalog.

    • O compute serverless deve estar habilitado para o seu workspace. Consulte Requisitos de compute serverless.

    • Para criar uma nova conexão, você deve ter privilégios CREATE CONNECTION no metastore. Consulte Gerenciar privilégios no Unity Catalog.

      Se o conector for compatível com a criação de pipelines baseada em interface do usuário, um administrador poderá criar a conexão e o pipeline ao mesmo tempo concluindo os passos desta página. No entanto, se os usuários que criarem pipelines usarem a criação de pipelines baseada em API ou forem usuários não administradores, um administrador deverá primeiro criar a conexão no Catalog Explorer. Consulte Conectar-se a fontes de ingestão gerenciadas.

    • Para usar uma conexão existente, você deve ter os privilégios USE CONNECTION ou ALL PRIVILEGES no objeto de conexão.

    • Você deve ter os privilégios USE CATALOG no catálogo de destino.

    • You must have USE SCHEMA and CREATE TABLE privileges on an existing schema or CREATE SCHEMA privileges on the target catalog.

  • Para fazer a ingestão do Shopify, primeiro configure a autenticação no Databricks e crie uma conexão. Consulte Configurar a autenticação para o Shopify e Criar uma conexão com o Shopify.

Opções do conector

Defina opções com escopo de pipeline em source_configurations. Consulte Exemplos para ver o uso.

Opção

Escopo

Obrigatório

Aplica-se a

Descrição

start_datetime

Pipeline

Não

Todas as tabelas incrementais

Data e hora mais antigas a partir das quais ingerir dados, no formato yyyy-MM-ddTHH:mm:ssXXX. O default é de 365 dias antes da primeira sincronização. Aplica-se apenas à primeira sincronização de cada tabela; as sincronizações posteriores são retomadas a partir do cursor armazenado.

Opção

Escopo

Obrigatório

Aplica-se a

Descrição

start_datetime

Pipeline

Não

Todas as tabelas incrementais

Data e hora mais antigas a partir das quais ingerir dados, no formato yyyy-MM-ddTHH:mm:ssXXX. O default é de 365 dias antes da primeira sincronização. Aplica-se apenas à primeira sincronização de cada tabela; as sincronizações posteriores são retomadas a partir do cursor armazenado.

Criar um pipeline de ingestão

Para obter a lista de tabelas de origem suportadas, consulte Tabelas de origem suportadas.

  1. Na barra lateral do workspace do Databricks, clique em Ingestão de dados .
  2. Na página Add data , em Databricks connectors , clique em Shopify .
  3. Na página Connection do assistente de ingestão, selecione a conexão que armazena suas credenciais do Shopify. Se você tiver o privilégio CREATE CONNECTION no metastore, clique em Ícone de mais. Create connection para criar uma conexão com as credenciais de Configure authentication to Shopify.
  4. Clique em Avançar .
  5. Na página Ingestion setup , insira um nome para o pipeline.
  6. Selecione um catálogo e um esquema para gravar os Logs de eventos. If you have USE CATALOG and CREATE SCHEMA privileges on the catalog, click Ícone de mais. Create schema in the drop-down menu to create a schema.
  7. Clique em Criar pipeline e continuar .
  8. Na página Source , selecione as tabelas para ingestão.
  9. Clique em Salvar e continuar .
  10. Na página Destination , selecione um catálogo e um esquema para carregar os dados. Se você tiver os privilégios USE CATALOG e CREATE SCHEMA no catálogo, clique em Ícone de mais. Create schema no menu suspenso para criar um esquema.
  11. Clique em Salvar e continuar .
  12. (Opcional) Na página Cronogramas e notificações , clique em Ícone de mais. Criar agendamento . Defina a frequência para refresh das tabelas de destino.
  13. (Opcional) Clique em Ícone de mais. Adicionar notificação para configurar notificações por email de sucesso ou falha na operação do pipeline, e clique em Salvar e executar pipeline .

Exemplos

The Shopify connector makes available 39 source tables in the default source schema. Ingest individual tables or the entire schema.

Ingerir tabelas específicas

Use esta opção para ingerir um subconjunto específico de tabelas ou para personalizar a nomenclatura de destino por tabela.

O seguinte arquivo de definição de pipeline ingere tabelas individuais do Shopify:

YAML
resources:
pipelines:
shopify_pipeline:
name: shopify_pipeline
catalog: 'main'
target: 'shopify_data'
ingestion_definition:
connection_name: shopify_connection
objects:
- table:
source_schema: 'default'
source_table: 'products'
destination_catalog: 'main'
destination_schema: 'shopify_data'
destination_table: 'products'
- table:
source_schema: 'default'
source_table: 'orders'
destination_catalog: 'main'
destination_schema: 'shopify_data'
destination_table: 'orders'
- table:
source_schema: 'default'
source_table: 'customers'
destination_catalog: 'main'
destination_schema: 'shopify_data'
destination_table: 'customers'

Ingerir a partir de uma data de início específica

Use a opção start_datetime para controlar até onde as tabelas incrementais realizam a leitura na primeira sincronização.

O seguinte arquivo de definição de pipeline ingere tabelas da Shopify a partir de uma data de início específica:

YAML
resources:
pipelines:
shopify_pipeline:
name: shopify_pipeline
catalog: 'main'
target: 'shopify_data'
ingestion_definition:
connection_name: shopify_connection
source_configurations:
- api_source_connector_config:
configs:
start_datetime: '<start-datetime>'
objects:
- table:
source_schema: 'default'
source_table: 'products'
destination_catalog: 'main'
destination_schema: 'shopify_data'
destination_table: 'products'
- table:
source_schema: 'default'
source_table: 'orders'
destination_catalog: 'main'
destination_schema: 'shopify_data'
destination_table: 'orders'

Ingerir o esquema inteiro

Use esta opção para ingerir todas as tabelas de origem da Shopify em um único esquema de destino com uma declaração.

O seguinte arquivo de definição de pipeline ingere todas as tabelas compatíveis do Shopify em um esquema de destino:

YAML
resources:
pipelines:
shopify_pipeline:
name: shopify_pipeline
catalog: 'main'
target: 'shopify_data'
ingestion_definition:
connection_name: shopify_connection
objects:
- schema:
source_schema: 'default'
destination_catalog: 'main'
destination_schema: 'shopify_data'

Arquivo de definição de job dos Pacotes de Automação Declarativa

O seguinte é um exemplo de arquivo de definição de job para uso com os Pacotes de Automação Declarativa. O job é executado diariamente.

YAML
resources:
jobs:
shopify_job:
name: shopify_job
schedule:
quartz_cron_expression: '0 0 0 * * ?'
timezone_id: 'UTC'
tasks:
- task_key: shopify_ingestion
pipeline_task:
pipeline_id: ${resources.pipelines.shopify_pipeline.id}

Padrões comuns

Para configurações avançadas de pipeline, consulte Padrões comuns para pipelines de ingestão gerenciados.

Passos seguintes

Começar, programar e definir alertas no seu pipeline. Consulte Tarefas comuns de manutenção de pipeline.

Outros recursos