メインコンテンツまでスキップ

Google Search Console からデータを取り込む

備考

ベータ版

この機能はベータ版です。ワークスペース管理者は、 プレビュー ページからこの機能へのアクセスを制御できます。Databricksのプレビューを管理するを参照してください。

このページでは、Lakeflow Connect を使用して管理された Google Search Console インジェストパイプラインを作成する方法について説明します。

要件

  • 取り込みパイプラインを作成するには、まず次の要件を満たす必要があります。

    • ワークスペースでUnity Catalogが有効になっている必要があります。

    • ワークスペースで Serverless コンピュートを有効にする必要があります。See Serverless コンピュートの要件.

    • 新しい接続を作成するには、メタストアに対する CREATE CONNECTION 権限が必要です。Unity Catalog での権限の管理を参照してください。

      コネクタが UI ベースのパイプライン オーサリングをサポートしている場合、管理者はこのページのステップを完了することで、接続とパイプラインを同時に作成できます。 ただし、パイプラインを作成するユーザーが API ベースのパイプライン オーサリングを使用している場合、または管理者以外のユーザーである場合、管理者はまずカタログ エクスプローラーで接続を作成する必要があります。 「管理対象取り込みソースへの接続」を参照してください。

    • 既存の接続を使用するには、接続オブジェクトに対する USE CONNECTION 権限または ALL PRIVILEGES 権限が必要です。

    • ターゲットカタログに対するUSE CATALOG権限が必要です。

    • 既存のスキーマに対する USE SCHEMA 権限と CREATE TABLE 権限、またはターゲットカタログに対する CREATE SCHEMA 権限が必要です。

  • Google Search Console から取り込むには、まず Databricks からの認証を構成し、接続を作成します。Google Search Console への認証の構成およびGoogle Search Console 接続の作成を参照してください。

コネクターのオプション

パイプラインスコープのオプションを source_configurations に設定し、テーブルスコープのオプションを個々のオブジェクトに設定します。使用方法については、「Examples」を参照してください。

オプション

スコープ

必須

適用対象

説明

site_urls

パイプライン

はい

すべてのテーブル

取り込む対象の、確認済み Google サーチコンソール プロパティURL(例:https://example.com/ または sc-domain:example.com)。各URLは、Google サーチコンソールで確認済みのプロパティである必要があります。

start_date

パイプライン

No

すべての増分テーブル (search_analytics_*hourly_search_analytics_*)

データを取り込む最も早い日付(yyyy-MM-dd形式)。最初の同期の500日前がdefault。sites または sitemaps には影響しません。

data_state

テーブル

No

日次検索パフォーマンステーブルのみ (search_analytics_*)

日次検索パフォーマンス テーブルのデータの鮮度。all (default)には、確定データと最新データが含まれます。final には確定データのみが含まれます。search_analytics_* オブジェクトに対してのみ設定してください。sitessitemaps、および hourly_search_analytics_* テーブルはこのオプションを受け付けません。

オプション

スコープ

必須

適用対象

説明

site_urls

パイプライン

はい

すべてのテーブル

取り込む対象の、確認済み Google サーチコンソール プロパティURL(例:https://example.com/ または sc-domain:example.com)。各URLは、Google サーチコンソールで確認済みのプロパティである必要があります。

start_date

パイプライン

No

すべての増分テーブル (search_analytics_*hourly_search_analytics_*)

データを取り込む最も早い日付(yyyy-MM-dd形式)。最初の同期の500日前がdefault。sites または sitemaps には影響しません。

data_state

テーブル

No

日次検索パフォーマンステーブルのみ (search_analytics_*)

日次検索パフォーマンス テーブルのデータの鮮度。all (default)には、確定データと最新データが含まれます。final には確定データのみが含まれます。search_analytics_* オブジェクトに対してのみ設定してください。sitessitemaps、および hourly_search_analytics_* テーブルはこのオプションを受け付けません。

取り込みパイプラインを作成

サポートされているソーステーブルの一覧については、サポートされているソーステーブルをご覧ください。

宣言型オートメーションバンドルを使用して、Google Search Console パイプラインをコードとして管理します。バンドルにはジョブとタスクの YAML 定義を含めることができ、Databricks CLI を使用して管理され、異なるターゲット ワークスペース(開発、ステージング、本番運用など)で共有および実行できます。詳細については、「宣言型オートメーションバンドルとは?」をご覧ください。

  1. Databricks CLIを使用してバンドルを作成するには:

    Bash
    databricks bundle init
  2. バンドルに2つの新しいリソースファイルを追加します:

    • パイプライン定義ファイル (例: resources/google_search_console_pipeline.yml)。See パイプライン.ingestion_definition および 「 例 」
    • データ取り込みの頻度を制御するジョブ定義ファイル(例:resources/google_search_console_job.yml)。
  3. Databricks CLIを使用してパイプラインをデプロイします:

    Bash
    databricks bundle deploy

Google Search Console コネクタは、default ソーススキーマの下で以下のソーステーブルを利用可能にします:

テーブルタイプ

テーブル

サイトテーブル

sites, sitemaps

日次検索パフォーマンスレポートテーブル

search_analytics_all_fieldssearch_analytics_by_countrysearch_analytics_by_datesearch_analytics_by_devicesearch_analytics_by_pagesearch_analytics_by_querysearch_analytics_page_reportsearch_analytics_site_report_by_pagesearch_analytics_site_report_by_site

毎時の検索パフォーマンスレポートテーブル

hourly_search_analytics_page_reporthourly_search_analytics_site_report_by_pagehourly_search_analytics_site_report_by_site

テーブルタイプ

テーブル

サイトテーブル

sites, sitemaps

日次検索パフォーマンスレポートテーブル

search_analytics_all_fieldssearch_analytics_by_countrysearch_analytics_by_datesearch_analytics_by_devicesearch_analytics_by_pagesearch_analytics_by_querysearch_analytics_page_reportsearch_analytics_site_report_by_pagesearch_analytics_site_report_by_site

毎時の検索パフォーマンスレポートテーブル

hourly_search_analytics_page_reporthourly_search_analytics_site_report_by_pagehourly_search_analytics_site_report_by_site

スキーマの詳細については、サポートされているソーステーブルを参照してください。

検索パフォーマンス レポート テーブルを取り込む

以下の例ではsearch_analytics_all_fieldsを取り込みます。これは、5つのすべてのディメンション(日付、国、デバイス、ページ、クエリー)で集計された日次パフォーマンスデータを返します。

YAML
resources:
pipelines:
google_search_console_pipeline:
name: google_search_console_pipeline
catalog: 'main'
target: 'google_search_console_data'
ingestion_definition:
connection_name: google_search_console_connection
source_configurations:
- api_source_connector_config:
configs:
site_urls: '["<site-url>"]'
start_date: '<start-date>'
objects:
- table:
source_schema: 'default'
source_table: 'search_analytics_all_fields'
destination_catalog: 'main'
destination_schema: 'google_search_console_data'
destination_table: 'search_analytics_all_fields'
connector_options:
api_source_connector_options:
options:
data_state: 'all'

サイトテーブルを取り込む

次の例では sites を取り込みます。これは、検証済みの Google Search Console プロパティに関するメタデータを返します。サイトテーブルはパイプラインが実行されるたびに完全に更新されるため、start_date はそれらに影響を与えず、data_state も受け付けません。

YAML
resources:
pipelines:
google_search_console_pipeline:
name: google_search_console_pipeline
catalog: 'main'
target: 'google_search_console_data'
ingestion_definition:
connection_name: google_search_console_connection
source_configurations:
- api_source_connector_config:
configs:
site_urls: '["<site-url>"]'
objects:
- table:
source_schema: 'default'
source_table: 'sites'
destination_catalog: 'main'
destination_schema: 'google_search_console_data'
destination_table: 'sites'

サイトおよび検索パフォーマンスのテーブルをまとめて取り込む

次の例では、サイトテーブルと検索パフォーマンスレポートテーブルを 1 つのパイプラインに結合します。

YAML
resources:
pipelines:
google_search_console_pipeline:
name: google_search_console_pipeline
catalog: 'main'
target: 'google_search_console_data'
ingestion_definition:
connection_name: google_search_console_connection
source_configurations:
- api_source_connector_config:
configs:
site_urls: '["<site-url>"]'
start_date: '<start-date>'
objects:
# sites does not accept data_state, so it has no connector_options block.
- table:
source_schema: 'default'
source_table: 'sites'
destination_catalog: 'main'
destination_schema: 'google_search_console_data'
destination_table: 'sites'
- table:
source_schema: 'default'
source_table: 'search_analytics_by_page'
destination_catalog: 'main'
destination_schema: 'google_search_console_data'
destination_table: 'search_analytics_by_page'
connector_options:
api_source_connector_options:
options:
data_state: 'final'

宣言型オートメーションバンドルのジョブ定義ファイル

以下は、宣言型オートメーションバンドルで使用するジョブ定義ファイルの例です。ジョブは毎日実行されます。

YAML
resources:
jobs:
google_search_console_job:
name: google_search_console_job
schedule:
quartz_cron_expression: '0 0 0 * * ?'
timezone_id: 'UTC'
tasks:
- task_key: google_search_console_ingestion
pipeline_task:
pipeline_id: ${resources.pipelines.google_search_console_pipeline.id}

一般的なパターン

高度なパイプライン構成については、「マネージド取り込みパイプラインの一般的なパターン」を参照してください。

次のステップ

パイプラインの起動、スケジュール、アラートの設定を行います。一般的なパイプラインのメンテナンス タスクを参照してください。

その他のリソース