メインコンテンツまでスキップ

Spark宣言型パイプライン

Apache Spark™宣言型パイプラインは、SQLとPythonでバッチおよびストリーミングデータパイプラインを構築するための宣言型フレームワークです。LakeFlow Pipelinesは、パフォーマンスが最適化されたDatabricks Runtime上で実行されながら、Spark宣言型パイプラインを拡張し、相互運用可能です。パイプラインの一般的なユースケースには、クラウドストレージ(Amazon S3、Azure ADLS Gen2、Google Cloud Storageなど)やメッセージバス(Apache Kafka、Amazon Kinesis、Google Pub/Sub、Azure EventHub、Apache Pulsarなど)などのソースからのデータ取り込み、およびインクリメンタルバッチおよびストリーミング変換が含まれます。

このセクションでは、パイプラインの使用に関する詳細な情報を提供します。以下のトピックは、作業を開始するのに役立ちます。

トピック

説明

パイプラインの概念

フロー、ストリーミングテーブル、およびマテリアライズドビューなどのパイプラインの高レベルの概念について説明します。

チュートリアル

チュートリアルに従って、パイプラインの使用を実際に体験してください。

パイプラインの開発

データの取り込みと変換のためのフローを作成するパイプラインを開発およびテストする方法を学びます。

パイプラインの構成

パイプラインをスケジュールおよび構成する方法を学習します。

パイプラインの監視

パイプラインを監視し、パイプライン クエリのトラブルシューティングを行う方法を学びます。

開発者

パイプラインを開発するときに Python と SQL を使用する方法を学びます。

スタンドアロンパイプライン

Databricks SQLまたはPythonでスタンドアロンのストリーミングテーブルおよびマテリアライズドビューの作成方法についてご確認ください。

ベストプラクティス

信頼性が高く、効率的で、保守可能なパイプラインを構築するための推奨パターンを学習します。

トピック

説明

パイプラインの概念

フロー、ストリーミングテーブル、およびマテリアライズドビューなどのパイプラインの高レベルの概念について説明します。

チュートリアル

チュートリアルに従って、パイプラインの使用を実際に体験してください。

パイプラインの開発

データの取り込みと変換のためのフローを作成するパイプラインを開発およびテストする方法を学びます。

パイプラインの構成

パイプラインをスケジュールおよび構成する方法を学習します。

パイプラインの監視

パイプラインを監視し、パイプライン クエリのトラブルシューティングを行う方法を学びます。

開発者

パイプラインを開発するときに Python と SQL を使用する方法を学びます。

スタンドアロンパイプライン

Databricks SQLまたはPythonでスタンドアロンのストリーミングテーブルおよびマテリアライズドビューの作成方法についてご確認ください。

ベストプラクティス

信頼性が高く、効率的で、保守可能なパイプラインを構築するための推奨パターンを学習します。

その他のリソース

このページの見出し