Aller au contenu principal

Spark Declarative Pipelines

Apache Spark™ Declarative Pipelines est un cadre déclaratif pour la création de pipelines de données batch et streaming en SQL et Python. Les Lakeflow pipelines étendent et sont interopérables avec Spark Declarative Pipelines, tout en s'exécutant sur le Databricks Runtime optimisé pour les performances. Les cas d'utilisation courants pour les pipelines incluent l'ingestion de données depuis des sources telles que le stockage cloud (comme Amazon S3, Azure ADLS Gen2 et Google Cloud Storage) et les bus de messages (tels qu'Apache Kafka, Amazon Kinesis, Google Pub/Sub, Azure EventHub et Apache Pulsar), ainsi que les transformations incrémentielles par batch et en streaming.

Cette section fournit des informations détaillées sur l'utilisation des pipelines. Les rubriques suivantes vous aident à start.

Sujet

Description

Concepts de pipeline

Découvrez les concepts généraux des pipelines, y compris les flux, les tables de streaming et les vues matérialisées.

Tutoriels

Suivez les tutoriels pour acquérir une expérience pratique de l'utilisation des pipelines.

Développez des pipelines

Découvrez comment développer et tester des pipelines qui créent des flux pour l'ingestion et la transformation de données.

Configurer les pipelines

Découvrez comment planifier et configurer des pipelines.

Surveiller les pipelines

Apprenez à superviser vos pipelines et à dépanner les query de pipeline.

Développeurs

Apprenez à utiliser Python et SQL lors du développement de pipelines.

Pipelines autonomes

Découvrez comment créer des tables de streaming autonomes et des vues matérialisées dans Databricks SQL ou Python.

Bonnes pratiques

Découvrez les modèles recommandés pour la construction de pipelines fiables, efficaces et maintenables.

Sujet

Description

Concepts de pipeline

Découvrez les concepts généraux des pipelines, y compris les flux, les tables de streaming et les vues matérialisées.

Tutoriels

Suivez les tutoriels pour acquérir une expérience pratique de l'utilisation des pipelines.

Développez des pipelines

Découvrez comment développer et tester des pipelines qui créent des flux pour l'ingestion et la transformation de données.

Configurer les pipelines

Découvrez comment planifier et configurer des pipelines.

Surveiller les pipelines

Apprenez à superviser vos pipelines et à dépanner les query de pipeline.

Développeurs

Apprenez à utiliser Python et SQL lors du développement de pipelines.

Pipelines autonomes

Découvrez comment créer des tables de streaming autonomes et des vues matérialisées dans Databricks SQL ou Python.

Bonnes pratiques

Découvrez les modèles recommandés pour la construction de pipelines fiables, efficaces et maintenables.

Ressources supplémentaires