Spark宣言型パイプライン
Apache Spark™宣言型パイプラインは、SQLとPythonでバッチおよびストリーミングデータパイプラインを構築するための宣言型フレームワークです。LakeFlow Pipelinesは、パフォーマンスが最適化されたDatabricks Runtime上で実行されながら、Spark宣言型パイプラインを拡張し、相互運用可能です。パイプラインの一般的なユースケースには、クラウドストレージ(Amazon S3、Azure ADLS Gen2、Google Cloud Storageなど)やメッセージバス(Apache Kafka、Amazon Kinesis、Google Pub/Sub、Azure EventHub、Apache Pulsarなど)などのソースからのデータ取り込み、およびインクリメンタルバッチおよびストリーミング変換が含まれます。
このセクションでは、パイプラインの使用に関する詳細な情報を提供します。以下のトピックは、作業を開始するのに役立ちます。
トピック | 説明 |
|---|---|
フロー、ストリーミングテーブル、およびマテリアライズドビューなどのパイプラインの高レベルの概念について説明します。 | |
チュートリアルに従って、パイプラインの使用を実際に体験してください。 | |
データの取り込みと変換のためのフローを作成するパイプラインを開発およびテストする方法を学びます。 | |
パイプラインをスケジュールおよび構成する方法を学習します。 | |
パイプラインを監視し、パイプライン クエリのトラブルシューティングを行う方法を学びます。 | |
パイプラインを開発するときに Python と SQL を使用する方法を学びます。 | |
Databricks SQLまたはPythonでスタンドアロンのストリーミングテーブルおよびマテリアライズドビューの作成方法についてご確認ください。 | |
信頼性が高く、効率的で、保守可能なパイプラインを構築するための推奨パターンを学習します。 |