Spark宣言型パイプライン
Apache Spark™宣言型パイプラインは、SQLとPythonでバッチおよびストリーミングデータパイプラインを構築するための宣言型フレームワークです。LakeFlow Pipelinesは、パフォーマンスが最適化されたDatabricks Runtime上で実行されながら、Spark宣言型パイプラインを拡張し、相互運用可能です。パイプラインの一般的なユースケースには、クラウドストレージ(Amazon S3、Azure ADLS Gen2、Google Cloud Storageなど)やメッセージバス(Apache Kafka、Amazon Kinesis、Google Pub/Sub、Azure EventHub、Apache Pulsarなど)などのソースからのデータ取り込み、およびインクリメンタルバッチおよびストリーミング変換が含まれます。
このセクションでは、パイプラインの使用に関する詳細な情報を提供します。以下のトピックは、作業を開始するのに役立ちます。
-
- How to use LakeFlow Pipelines
- こちらから開始してください。 各ステージのタスクへのLinkを使用して、パイプラインのライフサイクル全体にわたる使用方法とその理由を理解します。
-
- パイプラインの概念
- フロー、ストリーミングテーブル、およびマテリアライズドビューなどのパイプラインの高レベルの概念について説明します。
パイプラインの詳細については、以下を参照してください:
-
- チュートリアル
- チュートリアルに従って、パイプラインの使用を実際に体験してください。
-
- パイプラインの開発
- データの取り込みと変換のためのフローを作成するパイプラインを開発およびテストする方法を学びます。
-
- パイプラインの構成
- パイプラインをスケジュールおよび構成する方法を学習します。
-
- パイプラインの監視
- パイプラインを監視し、パイプライン クエリのトラブルシューティングを行う方法を学びます。
-
- 開発者
- パイプラインを開発するときに Python と SQL を使用する方法を学びます。
-
- スタンドアロンパイプライン
- Databricks SQLまたはPythonでスタンドアロンのストリーミングテーブルおよびマテリアライズドビューの作成方法についてご確認ください。
-
- ベストプラクティス
- 信頼性が高く、効率的で、保守可能なパイプラインを構築するための推奨パターンを学習します。