メインコンテンツまでスキップ

Lakeflow Designer でビジュアルデータ準備を作成する

Lakeflow Designer を使用すると、視覚的なドラッグ アンド ドロップ キャンバス上にデータ変換ワークフローを構築できます。 このページでは、データソースの追加や演算子の連結から、結果のプレビュー、 Unity Catalogへの書き込みまで、ビジュアルデータ準備の作成方法について説明します。

要件

Lakeflow Designer を使用するには、以下が必要です。

  • Unity Catalog が有効になっている Databricks ワークスペース。
  • CAN USE 少なくとも 1 つの汎用コンピュート リソース (サーバレスまたは汎用) に対する許可。

Designerの右上にある スケジュール ボタンの横にあるコンピュートピッカーから、使用するコンピュートを選択します。

新しいビジュアルデータ準備を作成する

新しいビジュアルデータ準備を作成するには、クリックします。プラスアイコン。サイドバーの 「新規」 から 「ビジュアルデータ準備」 を選択します。

Designerを起動すると、ウェルカム画面が表示され、そこでデータソースを追加したり、サンプルとなるビジュアルデータ準備を確認したりできます。

既存のビジュアルデータ準備ファイルを見つけるには、サイドバーから**Visual data prep**ページを開きます。 このページには、すべてのビジュアルデータ準備ファイルが一覧表示され、Lakeflow Designer の使用を起動するのに役立つ入門ビデオが含まれています。

データソースを追加する

すべてのビジュアルデータ準備は、1つ以上のデータソースから始まります。 ソース オペレーターは、キャンバス上のデータソースを表します。

データソースを追加するには:

  1. ソース演算子を追加します。ようこそ画面から、 [ソース オペレータの選択] をクリックします。キャンバスから演算子メニューを開き、 ソース を選択します。

  2. ソース 構成ペインで、データの取り込み方法を選択します:

    • 既存のテーブルを選択します。
    • ローカルのCSVファイルまたはExcelファイルをuploadしてください。
    • ファイルからテーブルを作成する。
    • GoogleドライブまたはSharePointからインポートしてください。
  3. データソースを選択または設定します。 ソース演算子がキャンバスに表示されます。

CSV または Excel ファイルをキャンバスに直接ドラッグ アンド ドロップして、ソース演算子をすばやく作成することもできます。

後でソースを変更するには、ソース演算子を開いて、 「新しいデータソースの選択」 をクリックします。 ソースを変更すると、すべての下流演算子の出力キャッシュが無効になります。

各取り込みオプションの詳細については、 Lakeflow Designer へのデータの取り込み」を参照してください。

オペレーターの追加と設定

オペレーターを追加するには、キャンバスの左側にあるサイドペインでオペレーターメニューを開きます。演算子をクリックしてキャンバスに追加します、または、メニューから演算子をキャンバスにドラッグします。既存の演算子の横にある**+**ボタンをクリックして、自動接続で新しい演算子を追加することもできます。

LFDオペレーターメニューは、キャンバス上にドラッグ&ドロップで配置できます。

オペレーターを構成するには、ダブルクリックするか、またはその上にカーソルを合わせて鉛筆アイコン。 (オペレーターの編集) をクリックして、構成ペインを開きます。そのオペレータータイプのオプションを設定し、 適用をクリックします。

各オペレーターの詳細については、 「Lakeflow Designer の組み込みオペレーター」を参照してください。独自のユーザー定義演算子を作成する方法の詳細については、 「Lakeflow Designer のユーザー定義演算子」を参照してください。

オペレーターを接続する

2つの演算子を接続するには、出力ハンドル(演算子の右端にある小さな円)から入力ハンドル(次の演算子の左端にある小さな円)までクリックしてドラッグします。これは、データが最初の演算子から2番目の演算子へ流れることを指定するものです。データは、ビジュアルデータ準備プロセスにおいて左から右へと流れます。

LFDキャンバスには、2人のオペレーター間の接続状況が表示されている。

JoinCombine などの一部の演算子は複数の入力を受け入れます。

接続を削除するには、接続の上にカーソルを合わせ、表示されるツールバーのごみ箱アイコンをクリックします。

Genie Codeを使用する

Lakeflow Designerで編集作業を行っている間はいつでも、Genie Codeへのプロンプトを作成して作業を補助することができます。See Genie Code.

LFD Genie Codeプロンプト

Genie Codeを使用する際、以下のボタンは追加機能を提供します。

  • ペーパークリップアイコンです。:プロンプトの一部として使用するファイルを添付します。
  • アイコンで。: プロンプトの一部として使用するテーブルやファイルなどのオブジェクトを指定する場合に使用します。
  • 吹き出しアイコン。新しいエージェントコンテキストで新しいチャットスレッドを開始します。
  • リーダーモードのアイコン。: 会話履歴のサイドペインを開き、エージェントが行っていることの詳細を表示します。

Genie Codeは、入力ボックスの上に最新の編集の1行の要約を表示します。

プレビュー結果

画面下部の出力ペインで結果を表示するには、任意の演算子を選択してください。ほとんどの演算子では、入力データは左側に、出力データは右側にあります。プロット、HTML、または画像など、表形式以外の結果を生成するオペレーターは、その出力を出力ペインに直接表示します。

出力ペインの表示コントロールを使用して、入力と出力(デフォルト)、入力のみ、または出力のみを切り替えます。結合ビューで、区切りをドラッグして入力ペインと出力ペインのサイズを変更します。

選択したオペレーターのランにパフォーマンスデータがある場合は、出力ペインの [パフォーマンス] をクリックして、完全なクエリープロファイルを開きます。

キャンバスの下にあるLFD出力ペイン。

By default, プレビュー用に限られたサンプルデータをオペレーターが処理します。ツールバーの プレビュー メニューを使用して、プレビュー用に処理する入力行のdefault数を設定します。「 最初のN行 」を選択して行数の上限を入力するか、「 すべての行 」を選択します。

出力ペインの Rows scanned メニューを使用して、個々のオペレーターのプレビュー行数を上書きできます。

  • スキャン行数:継承プレビュー メニューからのdefaultを使用します。
  • スキャンする行数:制限 :最初の N 行の入力行を処理します。メニューの横にあるフィールドに行制限を入力します。
  • スキャンした行:すべての行 :すべての入力行を処理します。

すべての行のプレビューを生成すると、キャンバス上のオペレーターの下に正確な出力行数が表示されます。複数の出力を持つオペレーターの場合、行数バッジにカーソルを合わせると、各出力の件数が表示されます。

警告

スキャン行数:すべての行 を指定してプレビューを生成すると、制限のない完全なデータセットを使用して演算子とその上流の演算子が再実行されるため、時間がかかることがあります。

Rows scanned の設定は、プレビュー処理のみを制御します。スケジュールされたランとジョブ ランは、完全なデータセットを処理します。

完全なビジュアルデータの準備を実行します

すべてラン 」をクリックすると、キャンバス上のすべてのオペレーターを個別にプレビューせずに、単一のアクションで全データセットに対して実行できます。Designerはビジュアルデータ準備ファイル全体を実行し、各オペレーターの結果を更新し、キャンバス上で各オペレーターの正確な出力行数を表示します。

結果テーブルでデータを直接変換する

データを変換するための演算子を追加することに加え、結果テーブルで直接操作を行うことでデータを準備できます。プレビュー内での編集はプレビューサンプルのみを変更し、 保留中の変更 として収集されます。これらを適用するまで、データやワークフローは変更されません。

LFD結果テーブルでの直接的なデータ編集:列に対して操作を行うと保留中の変更がステージングされ、「キャンバスに適用」によって演算子に変換されます。

データプレビューでは、次のアクションがサポートされています。

  • 列の挿入 : 列の挿入 を選択し、名前と式を入力します。
  • 列のタイプを変更タイプを変更 を選択し、ターゲットのタイプを選択します。
  • Null行の削除 : Nullの削除 を選択して、列がNullである行を排除します。
  • 行をフィルタ :列に1つ以上のフィルタ条件を追加します。
  • 列の名前を変更 :列ヘッダーをダブルクリックして、新しい名前を入力します。
  • 列の非表示、並べ替え、削除 : 列を非表示または削除するか、列ヘッダーをドラッグして並べ替えます。
  • 行の並べ替え :列の並べ替え方向を追加します。より多くの列で並べ替えると、並べ替え順序に追加されます。
  • 重複行を削除重複を削除 を選択し、比較する列を選択します。

保留中の変更を確認して適用

ステージングされた編集は、 保留中の変更 ペインに収集されます。適用前に編集内容を確認または削除するには、これを開きます。ステージングされた新しい列を変更するには、プレビューでその列をダブルクリックし、名前または式を更新します。

ステージングされた編集をワークフローに追加するには、 キャンバスに適用 を選択します。Lakeflow Designerは、編集の種類ごとに1つの演算子を、ステージングした順序で追加します。各種類の編集は演算子にマッピングされます:

プレビュー編集

キャンバスに追加された演算子

列を挿入

準備

列の型を変更

準備

Null 行を削除

フィルタ

行のフィルター

フィルタ

列の削除、名前の変更、並べ替え、または非表示

選択

行を並べ替える

並べ替え

重複行を削除

ユニーク

プレビュー編集

キャンバスに追加された演算子

列を挿入

準備

列の型を変更

準備

Null 行を削除

フィルタ

行のフィルター

フィルタ

列の削除、名前の変更、並べ替え、または非表示

選択

行を並べ替える

並べ替え

重複行を削除

ユニーク

注記

保留中の変更がある状態でプレビューを完全なデータセットの処理に切り替えると、Lakeflow Designerは、ステージングされた編集内容が失われないように、まずそれらを適用するように促します。

download results

出力ペインのdownloadコントロールを使用して、プレビュー結果をファイルにエクスポートします:

  • 表示されている行 : 現在プレビューに表示されている行を、CSVまたはExcelとしてdownloadします。
  • すべての行 : データセット全体をDownloadします。ワークフローを実行する権限がある場合に利用可能です。すべての行のExcelエクスポートには、Serverless コンピュートが必要です。

ワークスペース管理者は、downloadをオフにできます。

結果を書き込みます

結果を書き込むには、**Output**演算子を追加します。 Output演算子は、Unity Catalogテーブルへの書き込み、結果をマテリアライズドビューとして発行、またはCSV、Excel、JSONファイルをUnity Catalogボリュームに書き込むことができます。

  1. 演算子メニューを開いて [出力] を選択するか、最後の演算子の横にある + を クリックして [出力] を選択します。
  2. まだ接続されていない場合は、最後の変換の出力ハンドルを出力 オペレータ の入力ハンドルに接続します。
  3. 出力 オペレーターをダブルクリックして、その構成ペインを開きます。
  4. 出力タイプ を選択し、送信先を構成します。テーブルの場合は、 テーブル名 を入力し、 出力場所 (カタログとスキーマ)を選択してから、 書き込みモード を選択します。
  5. 実行 をクリックします。

出力タイプと書き込みモードの全セットについては、出力を参照してください。

本番運用でのスケジュールまたは実行

ワークフローをジョブとしてスケジュールすることで、自動化できます。上部メニューの [スケジュール] ボタンをクリックしてビジュアルデータ準備のスケジュール設定済みジョブを作成するか、ビジュアルデータ準備をより大きな Databricks ジョブにタスクとして追加します。

ビジュアルデータ準備を本番運用に移行し、Gitに保存し、宣言型自動化バンドルでデプロイし、環境間でパラメーター化する方法については、ビジュアルデータ準備ファイルを本番運用に移行するを参照してください。

LFDスケジュール制御により、ビジュアルデータ準備をジョブとして自動化できます。

ビジュアルデータ準備ファイルのインポートとエクスポート

ビジュアルデータの準備ファイルは、ワークスペースにネイティブに保存されます。それらをエクスポートおよびインポートして、ワークスペース間で移動したり、共有したりできます。

ビジュアルデータ準備ファイルをエクスポートするには:

  1. 右上隅にある ケバブメニューアイコン。 をクリックします。
  2. ファイル 」>「 エクスポート 」を選択します。
  3. ファイルは<file_name>.designer.ipynbとしてエクスポートされます。

Visual data prep ページからインポートするには:

  1. New 」の横にあるドロップダウン矢印をクリックし、次に「 Import file 」を選択します。
  2. .designer.ipynb ファイルをインポートするには、 [ビジュアルデータの準備] として選択し、ファイルを選択します。Designer は、インポートされたビジュアルデータの準備をエディタで開きます。
  3. uploadされたファイルのソースオペレーターを使用してビジュアルデータ準備を作成するには、 As source を選択し、1つ以上のCSV、JSON、Excel、またはPDFファイルをuploadします。

ワークスペース ファイルシステムからインポートするには:

  1. ワークスペースファイルシステムで、ケバブメニューアイコン。をクリックします。
  2. インポート 」を選択します。
  3. インポートするビジュアル データ準備ファイルを選択します。

Git でビジュアルデータ準備ファイルをバージョン管理し、本番運用に移行する方法については、ビジュアルデータ準備ファイルを本番運用に移行するを参照してください。

ビジュアルデータ準備ファイルの名前を変更する

ビジュアルデータ準備ファイルの名前を変更するには、エディターの上部にある名前が表示されているtabをクリックし、新しい名前を入力します。

ビジュアルデータ準備ファイルを削除する

ビジュアルデータ準備ファイルを削除するには、ファイルのケバブメニューアイコン。 ケバブメニューを開き、**ゴミ箱に移動**を選択します。

複数のビジュアルデータ準備ファイルを一度に削除するには、左側のナビゲーションから ワークスペース を開き、削除するファイルを選択し、リストの一番上にある ゴミ箱に移動 を選択します。

キャンバスで作業する際の追加のヒント

キャンバス上では、ビジュアルデータの準備を編集するのに役立つ以下の操作が利用できます。

  • **オペレーターの名前を変更する**:オペレーターの名前を変更するには、任意の構成ペインの上部にあるボックスをクリックします。分かりやすい名前は、ビジュアルデータプレップを一目で理解しやすくします。SQLオペレーターなど、一部のオペレーターは他のオペレーターの出力を名前で参照できます。
  • オペレーターのコピー :オペレーターにカーソルを合わせ、アイコンをコピーします。をクリックするか、オペレーターを選択して Cmd/Ctrl+C を押してから Cmd/Ctrl+V を押します。
  • 演算子を削除します : 演算子にカーソルを合わせ、その上に表示されるツールバーのごみ箱アイコンをクリックするか、演算子を選択して Delete キーを押します。
  • 演算子の有効化または無効化 :演算子またはグループを右クリックし、 無効化 を選択してランから除外するか、 有効化 を選択して再度含めます。無効化された演算子は出力行を生成しないため、有効化するまで下流の演算子は空の結果を受け取ります。
  • 自動レイアウト :クリックDAG 水平アイコン。ヘッダーツールバーで、すべての演算子をコンパクトなレイアウトに自動的に配置します。
  • フィット表示 :クリックアイコンに合わせて拡大します。ヘッダーツールバーで、現在のビューポート内のすべての演算子を表示します。
  • 元に戻す/やり直しCmd/Ctrl+ZCmd/Ctrl+Shift+Z を押すか、ヘッダーツールバーの元に戻す/やり直しボタンを使用します。
  • コマンドパレットを開く :macOS で Cmd+Shift+P または Windows で Ctrl+Shift+P を押すと、エディターのアクションにすばやくアクセスできます。
  • 生成されたコードを表示 :左側のパネルで 目次 を選択し、オペレーターを選択してから、 生成されたコード セクションを展開すると、Designerがそのオペレーター用に生成したコードを確認できます。詳細については、「目次」を参照してください。
  • バージョン履歴を表示 :クリック履歴アイコンです。右側のペインをクリックすると、ビジュアルデータ準備のバージョン履歴が開きます。そこには変更点の一覧が表示されます。バージョンを選択すると、キャンバス上に視覚的な差分が表示され、次のバージョンと比較されます。追加、削除、変更された演算子が強調表示されます。目次内の演算子にカーソルを合わせると、差分の両バージョンで一致する演算子がハイライト表示されます。

その他のリソース