Pular para o conteúdo principal

Importe dados do Google Search Console.

info

Beta

Esse recurso está em Beta. Os administradores do workspace podem controlar o acesso a esse recurso na página Pré-visualizações . Consulte Gerenciar prévias do Databricks.

Esta página mostra como criar um pipeline de ingestão gerenciado do Google Search Console usando o Lakeflow Connect.

Requisitos

  • Para criar um pipeline de ingestão, primeiro atenda aos seguintes requisitos:

    • Seu workspace deve estar habilitado para o Unity Catalog.

    • O compute serverless deve estar habilitado para seu workspace. Consulte Requisitos de compute serverless.

    • Para criar uma nova conexão, você deve ter privilégios CREATE CONNECTION no metastore. Consulte Gerenciar privilégios no Unity Catalog.

      Se o conector oferecer suporte à criação de pipeline baseada em IU, um administrador poderá criar a conexão e o pipeline ao mesmo tempo concluindo os passos nesta página. No entanto, se os usuários que criam pipelines usarem a criação de pipeline baseada em API ou forem usuários não administradores, um administrador deverá primeiro criar a conexão no Catalog Explorer. Consulte Conectar-se a fontes de ingestão gerenciadas.

    • Para usar uma conexão existente, você deve ter privilégios USE CONNECTION ou ALL PRIVILEGES no objeto de conexão.

    • Você deve ter privilégios USE CATALOG no catálogo de destino.

    • Você deve ter os privilégios USE SCHEMA e CREATE TABLE em um esquema existente ou privilégios CREATE SCHEMA no catálogo de destino.

  • Para realizar a ingestão do Google Search Console, primeiro configure a autenticação a partir do Databricks e crie uma conexão. Consulte Configurar a autenticação no Google Search Console e Criar uma conexão com o Google Search Console.

Opções de conector

Defina opções com escopo de pipeline em source_configurations e opções com escopo de tabela no objeto individual. Consulte Exemplos para obter informações sobre o uso.

Opção

Escopo

Obrigatório

Aplica-se a

Descrição

site_urls

Pipeline

Sim

Todas as tabelas

Um ou mais URLs de propriedade verificados do Google Search Console para ingerir (por exemplo, https://example.com/ ou sc-domain:example.com). Cada URL deve ser uma propriedade verificada no Google Search Console.

start_date

Pipeline

Não

Todas as tabelas incrementais (search_analytics_*, hourly_search_analytics_*)

Data mais antiga a partir da qual ingerir dados, no formato yyyy-MM-dd. O default é de 500 dias antes da primeira sincronização. Não tem efeito em sites ou sitemaps.

data_state

Tabela

Não

Somente tabelas de desempenho de pesquisa diária (search_analytics_*)

Atualização dos dados para tabelas diárias de desempenho de pesquisa. all (default) inclui dados finalizados e recentes. final inclui apenas dados finalizados. Defina-o apenas em objetos search_analytics_*. As tabelas sites, sitemaps e hourly_search_analytics_* não aceitam esta opção.

Opção

Escopo

Obrigatório

Aplica-se a

Descrição

site_urls

Pipeline

Sim

Todas as tabelas

Um ou mais URLs de propriedade verificados do Google Search Console para ingerir (por exemplo, https://example.com/ ou sc-domain:example.com). Cada URL deve ser uma propriedade verificada no Google Search Console.

start_date

Pipeline

Não

Todas as tabelas incrementais (search_analytics_*, hourly_search_analytics_*)

Data mais antiga a partir da qual ingerir dados, no formato yyyy-MM-dd. O default é de 500 dias antes da primeira sincronização. Não tem efeito em sites ou sitemaps.

data_state

Tabela

Não

Somente tabelas de desempenho de pesquisa diária (search_analytics_*)

Atualização dos dados para tabelas diárias de desempenho de pesquisa. all (default) inclui dados finalizados e recentes. final inclui apenas dados finalizados. Defina-o apenas em objetos search_analytics_*. As tabelas sites, sitemaps e hourly_search_analytics_* não aceitam esta opção.

Criar um pipeline de ingestão

Para obter a lista de tabelas de origem suportadas, consulte Tabelas de origem suportadas.

Use os Pacotes de Automação Declarativa para gerenciar pipelines do Google Search Console como código. Os pacotes podem conter definições YAML de Jobs e tarefas, são gerenciados usando a CLI do Databricks e podem ser compartilhados e ter execução em diferentes workspaces de destino (como desenvolvimento, staging e produção). Para obter mais informações, consulte O que são os Pacotes de Automação Declarativa?.

  1. Crie um pacote usando a CLI do Databricks:

    Bash
    databricks bundle init
  2. Adicione dois novos arquivos de recursos ao pacote:

    • Um arquivo de definição de pipeline (por exemplo, resources/google_search_console_pipeline.yml). Consulte pipeline.ingestion_definition e Exemplos.
    • Um arquivo de definição de job que controla a frequência da ingestão de dados (por exemplo, resources/google_search_console_job.yml).
  3. Implantar o pipeline usando a CLI do Databricks:

    Bash
    databricks bundle deploy

Exemplos

O conector do Google Search Console disponibiliza as seguintes tabelas de origem no esquema de origem default:

Tipo de tabela

tabelas

Tabelas do site

sites, sitemaps

Tabelas de relatório diário de desempenho de pesquisa

search_analytics_all_fields, search_analytics_by_country, search_analytics_by_date, search_analytics_by_device, search_analytics_by_page, search_analytics_by_query, search_analytics_page_report, search_analytics_site_report_by_page, search_analytics_site_report_by_site

Tabelas de relatório de desempenho de pesquisa por hora

hourly_search_analytics_page_report, hourly_search_analytics_site_report_by_page, hourly_search_analytics_site_report_by_site

Tipo de tabela

tabelas

Tabelas do site

sites, sitemaps

Tabelas de relatório diário de desempenho de pesquisa

search_analytics_all_fields, search_analytics_by_country, search_analytics_by_date, search_analytics_by_device, search_analytics_by_page, search_analytics_by_query, search_analytics_page_report, search_analytics_site_report_by_page, search_analytics_site_report_by_site

Tabelas de relatório de desempenho de pesquisa por hora

hourly_search_analytics_page_report, hourly_search_analytics_site_report_by_page, hourly_search_analytics_site_report_by_site

Para detalhes do esquema, consulte Tabelas de origem compatíveis.

Ingerir uma tabela de relatório de desempenho de pesquisa

O exemplo a seguir ingere search_analytics_all_fields, que retorna dados de desempenho diários agregados em todas as cinco dimensões (data, país, dispositivo, página, query).

YAML
resources:
pipelines:
google_search_console_pipeline:
name: google_search_console_pipeline
catalog: 'main'
target: 'google_search_console_data'
ingestion_definition:
connection_name: google_search_console_connection
source_configurations:
- api_source_connector_config:
configs:
site_urls: '["<site-url>"]'
start_date: '<start-date>'
objects:
- table:
source_schema: 'default'
source_table: 'search_analytics_all_fields'
destination_catalog: 'main'
destination_schema: 'google_search_console_data'
destination_table: 'search_analytics_all_fields'
connector_options:
api_source_connector_options:
options:
data_state: 'all'

Ingerir uma tabela de sites

O exemplo a seguir ingere sites, que retorna metadados sobre suas propriedades verificadas do Google Search Console. As tabelas do site são totalmente atualizadas a cada execução de pipeline, portanto, start_date não tem efeito sobre elas e elas não aceitam data_state.

YAML
resources:
pipelines:
google_search_console_pipeline:
name: google_search_console_pipeline
catalog: 'main'
target: 'google_search_console_data'
ingestion_definition:
connection_name: google_search_console_connection
source_configurations:
- api_source_connector_config:
configs:
site_urls: '["<site-url>"]'
objects:
- table:
source_schema: 'default'
source_table: 'sites'
destination_catalog: 'main'
destination_schema: 'google_search_console_data'
destination_table: 'sites'

Ingerir tabelas de desempenho de site e pesquisa juntas

O exemplo a seguir combina uma tabela de site e uma tabela de relatório de desempenho de pesquisa em um único pipeline.

YAML
resources:
pipelines:
google_search_console_pipeline:
name: google_search_console_pipeline
catalog: 'main'
target: 'google_search_console_data'
ingestion_definition:
connection_name: google_search_console_connection
source_configurations:
- api_source_connector_config:
configs:
site_urls: '["<site-url>"]'
start_date: '<start-date>'
objects:
# sites does not accept data_state, so it has no connector_options block.
- table:
source_schema: 'default'
source_table: 'sites'
destination_catalog: 'main'
destination_schema: 'google_search_console_data'
destination_table: 'sites'
- table:
source_schema: 'default'
source_table: 'search_analytics_by_page'
destination_catalog: 'main'
destination_schema: 'google_search_console_data'
destination_table: 'search_analytics_by_page'
connector_options:
api_source_connector_options:
options:
data_state: 'final'

Arquivo de definição de job dos Pacotes de Automação Declarativa

O exemplo a seguir é um arquivo de definição de Job para uso com Pacotes de Automação Declarativa. O Job é executado diariamente.

YAML
resources:
jobs:
google_search_console_job:
name: google_search_console_job
schedule:
quartz_cron_expression: '0 0 0 * * ?'
timezone_id: 'UTC'
tasks:
- task_key: google_search_console_ingestion
pipeline_task:
pipeline_id: ${resources.pipelines.google_search_console_pipeline.id}

Padrões comuns

Para configurações avançadas de pipelines, consulte Padrões comuns para pipelines de ingestão gerenciada.

Passos seguintes

Comece, programe e defina alertas em seu pipeline. Consulte Tarefas comuns de manutenção de pipeline.

Outros recursos