Aller au contenu principal

Apache Spark Declarative Pipelines

Les LakeFlow Pipelines sont basés sur les Pipelines déclaratifs Apache Spark™ (SDP). LakeFlow Pipelines s'exécutent sur le Databricks Runtime optimisé pour la performance, et sont interopérables avec SDP. Parce que les pipelines s'appuient sur SDP plutôt que sur des APIs propriétaires, le code de transformation que vous écrivez reste portable vers d'autres runtimes SDP.

Qu'est-ce que Spark Declarative Pipelines ?

Apache Spark Declarative Pipelines est un cadre déclaratif pour le développement et l'exécution de pipelines de données batch et streaming en SQL et Python. SDP automatise l'orchestration et organise les dépendances entre les flux de votre pipeline. SDP simplifie le développement de l'ingestion et des Transformations, afin que vous n'ayez pas à vous concentrer sur la mécanique de l'orchestration de vos workflows de données.

Les cas d'utilisation courants de SDP comprennent :

  • Ingestion de données par batch à partir de sources telles que le stockage cloud (Amazon S3, Azure ADLS Gen2 et Google Cloud Storage).
  • Ingestion incrémentielle de données à partir de bus de messages (tels que Apache Kafka, Amazon Kinesis, Google Pub/Sub, Azure EventHub et Apache Pulsar).
  • Transformations incrémentielles par batch et en streaming avec des opérateurs sans état et avec état.

Pour plus de détails sur le traitement déclaratif des données, consultez Traitement procédural vs. déclaratif des données dans Databricks.

Comment les LakeFlow Pipelines étendent-ils le SDP ?

Les LakeFlow Pipelines partagent le même modèle de création déclaratif que SDP et ajoutent des fonctionnalités de production telles que AUTO CDC, les attentes en matière de qualité des données et un événement Log interrogeable. Ce tableau compare les capacités que les Lakeflow pipelines partagent avec SDP et les fonctionnalités de production que Databricks y ajoute. Pour un mappage propriété par propriété entre la spécification de projet SDP et la configuration du pipeline, consultez Référence des propriétés de pipeline.

Compétence

SDP

LakeFlow Pipelines

Pipelines déclaratifs en SQL et Python

Tables de streaming

Vues matérialisées

Vues temporaires

Ajouter des flux

Puits (Delta, Apache Kafka et Azure Event Hubs)

Orchestration automatique et résolution des dépendances.

Code de pipeline portable entre les environnements d'exécution SDP

AUTO CDC (SCD de type 1 et SCD de type 2) et AUTO CDC à partir d'un instantané

Attentes en matière de qualité des données

event loginterrogeable

Mettre à jour les flux et les foreachBatch puits

Mode continu

Compétence

SDP

LakeFlow Pipelines

Pipelines déclaratifs en SQL et Python

Tables de streaming

Vues matérialisées

Vues temporaires

Ajouter des flux

Puits (Delta, Apache Kafka et Azure Event Hubs)

Orchestration automatique et résolution des dépendances.

Code de pipeline portable entre les environnements d'exécution SDP

AUTO CDC (SCD de type 1 et SCD de type 2) et AUTO CDC à partir d'un instantané

Attentes en matière de qualité des données

event loginterrogeable

Mettre à jour les flux et les foreachBatch puits

Mode continu

Ressources supplémentaires