Spark Declarative Pipelines
Apache Spark™ Declarative Pipelines est un cadre déclaratif pour la création de pipelines de données batch et streaming en SQL et Python. Les Lakeflow pipelines étendent et sont interopérables avec Spark Declarative Pipelines, tout en s'exécutant sur le Databricks Runtime optimisé pour les performances. Les cas d'utilisation courants pour les pipelines incluent l'ingestion de données depuis des sources telles que le stockage cloud (comme Amazon S3, Azure ADLS Gen2 et Google Cloud Storage) et les bus de messages (tels qu'Apache Kafka, Amazon Kinesis, Google Pub/Sub, Azure EventHub et Apache Pulsar), ainsi que les transformations incrémentielles par batch et en streaming.
Cette section fournit des informations détaillées sur l'utilisation des pipelines. Les rubriques suivantes vous aident à start.
Sujet | Description |
|---|---|
Découvrez les concepts généraux des pipelines, y compris les flux, les tables de streaming et les vues matérialisées. | |
Suivez les tutoriels pour acquérir une expérience pratique de l'utilisation des pipelines. | |
Découvrez comment développer et tester des pipelines qui créent des flux pour l'ingestion et la transformation de données. | |
Découvrez comment planifier et configurer des pipelines. | |
Apprenez à superviser vos pipelines et à dépanner les query de pipeline. | |
Apprenez à utiliser Python et SQL lors du développement de pipelines. | |
Découvrez comment créer des tables de streaming autonomes et des vues matérialisées dans Databricks SQL ou Python. | |
Découvrez les modèles recommandés pour la construction de pipelines fiables, efficaces et maintenables. |