Desenvolva o código do pipeline em seu ambiente de desenvolvimento local.
Você pode criar código-fonte de pipeline Python em seu ambiente de desenvolvimento integrado (IDE) preferido, executá-lo localmente para teste e, em seguida, validar, implantar e executar atualizações em seu workspace do Databricks sem sair do seu ambiente local.
LakeFlow Pipelines são um superconjunto de Apache Spark™ Declarative Pipelines. O código que usa apenas APIs do Apache Spark Declarative Pipelines é executado tanto localmente quanto no Databricks, mas o código que usa recursos exclusivos dos LakeFlow Pipelines, como AUTO CDC e expectativas, é executado apenas no Databricks. Para as diferenças de recursos, consulte referência da linguagem Python dos LakeFlow Pipelines.
Para desenvolvimento interativo e teste no workspace do Databricks, use o Editor de Lakeflow Pipelines. Consulte Desenvolver e depurar pipelines ETL com o Editor de Lakeflow Pipelines.
Escrever código de pipeline com suporte de IDE
Escreva o código do pipeline usando o módulo pyspark.pipelines, importado como dp:
from pyspark import pipelines as dp
Como o módulo faz parte do Apache Spark, sua IDE oferece verificação de sintaxe, preenchimento automático e verificação de tipo enquanto você escreve. O código do Apache Spark Declarative Pipelines normalmente é executado sem modificações no Databricks. Executar o mesmo comando de importação em um LakeFlow Pipelines importa a versão do Databricks de pipelines. Para a referência completa do Python dos LakeFlow Pipelines, consulte Referência da linguagem Python dos LakeFlow Pipelines.
Executar pipelines localmente para teste
Você também pode executar pipelines localmente para desenvolver e testar seu código antes de executá-lo no Databricks. Use a interface de linha de comando spark-pipelines para inicializar, validar e executar um pipeline com Apache Spark local. Consulte o Guia de Programação do Spark Declarative Pipelines na documentação do Apache Spark.
Não é possível executar ou testar funcionalidades específicas para LakeFlow Pipelines localmente. Isso inclui expectativas e funções AUTO CDC.
Executar pipelines no Databricks do seu ambiente local
Use o grupo de comandos databricks pipelines para validar, implantar e executar atualizações de pipeline em seu workspace, diretamente do seu terminal:
databricks pipelines init # scaffold a pipeline project
databricks pipelines dry-run # validate the pipeline graph without publishing data
databricks pipelines deploy # deploy the project to your workspace
databricks pipelines run # run an update
As atualizações de pipeline são executadas no seu workspace do Databricks, e não na sua máquina local, usando o compute configurado para o pipeline. Esses comandos são interoperáveis com comandos bundle do Pacotes de Automação Declarativa, portanto, você pode começar com um projeto simples e adotar a configuração de pacote e as práticas de CI/CD à medida que ele cresce. Para instalar e configurar a CLI, consulte Instalar ou atualizar a CLI do Databricks. Para a referência completa de comandos, consulte pipelines grupo de comandos. Para um passo a passo detalhado, consulte Desenvolver pipelines com Pacotes de Automação Declarativa.
Sincronize o código pipeline do seu IDE com um workspace
A tabela a seguir resume as opções para sincronizar o código-fonte pipeline entre seu IDE local e um workspace Databricks :
Ferramenta ou padrão | Detalhes |
|---|---|
CLI do Databricks (grupo de comandos | Use os comandos |
Pacotes de Automação Declarativa | Utilize pacotes de automação declarativa para implantar pipeline ativos com diferentes níveis de complexidade, desde um único arquivo de código-fonte até configurações para múltiplos pipelines, jobs e arquivos de código-fonte. Consulte Converter um pipeline em um projeto de pacote. |
Extensão do Databricks para Visual Studio Code | Databricks oferece integração com o Visual Studio Code, incluindo sincronização fácil entre seu ambiente de desenvolvimento integrado (IDE) local e os arquivos workspace . Esta extensão também fornece ferramentas para usar Declarative Automation Bundles para implantar pipelines ativos. Veja a extensão Databricks para Visual Studio Code. |
arquivos de espaço de trabalho | Você pode usar os arquivos workspace Databricks para upload o código-fonte pipeline no seu workspace Databricks e depois importar esse código para um pipeline. Veja O que são arquivos workspace ?. |
Pastas Git | As pastas Git permitem sincronizar o código entre o seu ambiente local e workspace Databricks , usando um repositório Git como intermediário. Consulte as pastas Git do Databricks. |