Aller au contenu principal

Développer le code de pipeline dans votre environnement de développement local

Vous pouvez créer du code source de pipeline Python dans votre environnement de développement intégré (IDE) préféré, l'exécuter localement pour des tests, puis valider, déployer et exécuter les mises à jour dans votre Workspace Databricks sans quitter votre environnement local.

Les LakeFlow Pipelines sont un sur-ensemble des Spark Declarative Pipelines Apache Spark™. Le code qui utilise uniquement les APIs des Spark Declarative Pipelines Apache Spark™ s'exécute à la fois localement et sur Databricks, mais le code qui utilise des fonctionnalités uniques aux LakeFlow Pipelines, telles que AUTO CDC et les attentes, s'exécute uniquement sur Databricks. Pour les différences de fonctionnalités, consultez la référence linguistique Python des LakeFlow Pipelines.

Pour le développement et les tests interactifs dans le Databricks workspace, utilisez le Lakeflow Pipelines Editor. Consultez Développer et déboguer les pipelines ETL avec l'éditeur Lakeflow Pipelines.

Écrivez du code de pipeline avec le support de l'IDE

Écrivez le code du pipeline en utilisant le module pyspark.pipelines, importé en tant que dp:

Python
from pyspark import pipelines as dp

Puisque le module fait partie d'Apache Spark, votre IDE fournit la vérification de la syntaxe, l'autocomplétion et la vérification de type au fur et à mesure que vous écrivez. Le code Spark Declarative Pipelines d'Apache s'exécute généralement sans modification sur Databricks. L'exécution de la même commande d'importation dans un LakeFlow pipeline importe la version Databricks de pipelines. Pour la référence complète du langage Python pour les LakeFlow Pipelines, veuillez consulter la référence linguistique Python pour les LakeFlow Pipelines.

Exécutez les pipelines localement pour les tests

Vous pouvez également exécuter des pipelines localement pour développer et tester votre code avant de l'exécuter sur Databricks. Utilisez l'interface de ligne de commande spark-pipelines pour initialiser, valider et exécuter un pipeline avec Apache Spark local. Consultez le guide de programmation Spark Declarative Pipelines dans la documentation Apache Spark.

Vous ne pouvez pas exécuter ou tester localement des fonctionnalités spécifiques aux LakeFlow Pipelines. Cela inclut les attentes et les AUTO CDC fonctions.

Exécuter des pipelines dans Databricks à partir de votre environnement local

Utilisez le groupe de commandes databricks pipelines pour valider, déployer et exécuter les mises à jour du pipeline dans votre workspace, directement depuis votre terminal :

Bash
databricks pipelines init      # scaffold a pipeline project
databricks pipelines dry-run # validate the pipeline graph without publishing data
databricks pipelines deploy # deploy the project to your workspace
databricks pipelines run # run an update

Les mises à jour de pipeline s'exécutent dans votre Workspace Databricks, et non sur votre machine locale, en utilisant le compute configuré pour le pipeline. Ces commandes sont interopérables avec les commandes Declarative Automation Bundles bundle, vous pouvez donc start par un projet simple et adopter la configuration de bundle et les pratiques CI/CD à mesure qu'il évolue. Pour installer et configurer la CLI, veuillez consulter Installer ou mettre à jour la CLI Databricks. Pour la référence complète des commandes, veuillez consulter groupe de commandespipelines. Pour un guide pas à pas, veuillez consulter Développer des pipelines avec des Declarative Automation Bundles.

Synchroniser le code de pipeline de votre IDE vers un workspace

Le tableau suivant récapitule les options de synchronisation du code source du pipeline entre votre IDE local et un Workspace Databricks :

Outil ou modèle

Détails

Databricks CLI (groupe de commandes pipelines)

Utilisez les commandes databricks pipelines pour déployer et exécuter un projet de pipeline depuis votre environnement local. Voir pipelines groupe de commandes.

Declarative Automation Bundles

Utilisez les bundles d’automatisation déclaratifs pour déployer des assets de pipeline dont la complexité varie d’un fichier de code source unique à des configurations pour plusieurs pipelines, Jobs et fichiers de code source. Voir Convertir un pipeline en projet de bundle.

Extension Databricks pour Visual Studio Code

Databricks fournit une intégration avec Visual Studio Code qui inclut une synchronisation facile entre votre IDE local et les fichiers du workspace. Cette extension fournit également des outils pour utiliser les Bundles d'automatisation déclaratifs afin de déployer des assets de pipeline. Consultez l'extension Databricks pour Visual Studio Code.

Fichiers du workspace

Vous pouvez utiliser les fichiers de votre workspace Databricks pour upload le code source de votre pipeline dans votre workspace Databricks, puis importer ce code dans un pipeline. Consultez Qu'est-ce qu'un fichier de workspace ?.

Dossiers Git

Les dossiers Git vous permettent de synchroniser le code entre votre environnement local et le Workspace Databricks en utilisant un repository Git comme intermédiaire. Consultez les dossiers Git Databricks.

Outil ou modèle

Détails

Databricks CLI (groupe de commandes pipelines)

Utilisez les commandes databricks pipelines pour déployer et exécuter un projet de pipeline depuis votre environnement local. Voir pipelines groupe de commandes.

Declarative Automation Bundles

Utilisez les bundles d’automatisation déclaratifs pour déployer des assets de pipeline dont la complexité varie d’un fichier de code source unique à des configurations pour plusieurs pipelines, Jobs et fichiers de code source. Voir Convertir un pipeline en projet de bundle.

Extension Databricks pour Visual Studio Code

Databricks fournit une intégration avec Visual Studio Code qui inclut une synchronisation facile entre votre IDE local et les fichiers du workspace. Cette extension fournit également des outils pour utiliser les Bundles d'automatisation déclaratifs afin de déployer des assets de pipeline. Consultez l'extension Databricks pour Visual Studio Code.

Fichiers du workspace

Vous pouvez utiliser les fichiers de votre workspace Databricks pour upload le code source de votre pipeline dans votre workspace Databricks, puis importer ce code dans un pipeline. Consultez Qu'est-ce qu'un fichier de workspace ?.

Dossiers Git

Les dossiers Git vous permettent de synchroniser le code entre votre environnement local et le Workspace Databricks en utilisant un repository Git comme intermédiaire. Consultez les dossiers Git Databricks.