Mover um arquivo de preparação de dados visuais para produção
Cada arquivo visual de preparação de dados que você cria no Lakeflow Designer é apoiado por código pronto para produção e armazenado como um Notebook chamado <name>.designer.ipynb. Você pode movê-lo para produção com as mesmas ferramentas que você usa para outro código do Databricks: armazene-o no Git, execute-o como um Job e implante-o com Pacotes de Automação Declarativa.
Esta página explica como levar um arquivo de preparação visual de dados do protótipo à produção.
Armazenar e versionar no Git
O workspace armazena arquivos de preparação visual de dados nativamente. Para versionar um arquivo de preparação visual de dados, coloque-o em uma pasta Git e o acompanhe como qualquer outro notebook:
- Crie uma pasta Git em seu workspace.
- Mova o arquivo de preparação de dados visuais para essa pasta Git.
- Rastreie, faça commit e crie a versão do arquivo como qualquer outro Notebook no Git. No Git, o arquivo aparece como
<file_name>.designer.ipynb.
Para saber mais sobre pastas Git, consulte pastas Git do Databricks. Para exportar ou importar um arquivo de preparação de dados visuais, consulte Exportar e importar um arquivo de preparação de dados visuais.
Programar como um Job
É possível automatizar um arquivo de preparação de dados visuais programando-o como um job.
- Programar diretamente : Clique no botão Programar no menu superior para criar um job programado para seu arquivo de preparação de dados visuais.
- Adicionar a um Job : Crie um Job da Databricks e adicione seu arquivo de preparação visual de dados como uma tarefa. Isso permite que você combine esse arquivo de preparação visual de dados com outras tarefas em um pipeline maior. No menu suspenso Tipo da tarefa, selecione Preparação visual de dados e, em seguida, selecione o arquivo.
Execuções programadas exibem cada operador como um nó individual no gráfico de tarefas de Jobs, para que você possa inspecionar os resultados por operador em uma execução da mesma forma que faz na tela.
Para exibir e gerenciar agendamentos existentes, clique em **Agendamento** novamente para abrir a lista. Clique em **Adicionar agendamento** para criar outro, ou abra o menu kebab de um agendamento para **Editar**, **Executar agora**, **Pausar**, **Clonar**, **Exibir em Jobs** ou **Excluir**.
Exibir saída do operador em uma execução.
Por default, uma execução programada gera saída apenas para operadores terminais (operadores sem conexão downstream), como um operador de Saída. Para ver os resultados de cada operador na execução, expanda **Configurações avançadas** na caixa de diálogo de agendamento e selecione **Exibir saída do operador**.

Desative esta opção para telas grandes para evitar exceder o limite de tamanho de saída da execução.
Selecione o ambiente serverless
Ao trabalhar com um arquivo de preparação de dados visuais, é possível selecionar o ambiente Serverless usado tanto para execuções interativas quanto para jobs programados. Configure-o a partir do painel lateral **Ambiente** na barra lateral direita, da mesma forma que para um notebook. Em **Ambiente base**, selecione uma versão de ambiente. Consulte Configure o ambiente Serverless.
Parametrizar entre ambientes
Os parâmetros são valores nomeados definidos para o arquivo de preparação de dados visuais como um todo que você pode referenciar de operadores SQL e Python. Para obter detalhes sobre como definir e referenciar parâmetros, consulte Parâmetros.
Parâmetros permitem executar o mesmo arquivo de preparação de dados visual em diferentes ambientes, por exemplo, um catálogo de teste durante o desenvolvimento e um catálogo de produção em produção.
- Ao programar um Job na UI : Substitua os valores de parâmetros para cada programação. Por exemplo, crie uma programação que execute com um parâmetro
environmentdefinido comoteste outra que execute com ele definido comoproduction. - Ao implantar com um pacote : defina os valores de parâmetro por meio do
parametersdo Job e use destinos de pacote para fornecer valores diferentes por ambiente. Os destinos de desenvolvimento e produção de pacotes permitem implantar o mesmo Job em ambientes separados com configurações específicas do ambiente. Consulte os modos de implantação de Pacotes de Automação Declarativa e a configuração de Pacotes de Automação Declarativa.
Em Runtime, um arquivo de preparação de dados visuais lê seus parâmetros da mesma forma, seja executado interativamente ou como um Job, de modo que o mesmo arquivo funciona em todos os seus ambientes sem alterações.
Ler de tabelas diferentes por ambiente
Para ler de uma tabela de origem diferente em cada ambiente, use um operador SQL com parâmetros em vez de um operador de Origem fixo. Defina os parâmetros catalog, schema e table, em seguida, referencie-os com a cláusula IDENTIFIER() para construir o nome da tabela dinamicamente:
SELECT * FROM IDENTIFIER(:catalog || '.' || :schema || '.' || :table)
Modifique os parâmetros catalog, schema ou table por agendamento ou destino do bundle para apontar o mesmo arquivo de preparação de dados visuais para dados de teste durante o desenvolvimento e dados de produção em produção. Para saber mais sobre a cláusula IDENTIFIER(), consulte cláusula IDENTIFIER.
Implantar com pacotes de automação declarativa
Os Pacotes de Automação Declarativa permitem que você defina e implante recursos do Databricks, como Jobs, como arquivos de origem, para que você possa aplicar as melhores práticas de engenharia de software, como controle de código-fonte, revisão de código, testes e CI/CD, aos seus arquivos visuais de preparação de dados. Consulte O que são Pacotes de Automação Declarativa?.
Para implantar um arquivo de preparação visual de dados com um pacote, defina uma tarefa de notebook e referencie o caminho do arquivo .designer.ipynb em notebook_task.notebook_path. Em um pacote, um arquivo de preparação visual de dados usa a notebook_task key, embora a UI de Jobs a mostre como um tipo de tarefa de **preparação visual de dados**.
O exemplo a seguir define um job que executa um arquivo de preparação de dados visuais localizado ao lado do arquivo de configuração do pacote:
resources:
jobs:
daily_prep_job:
name: daily_prep_job
tasks:
- task_key: run_visual_data_prep
notebook_task:
notebook_path: ./my_transformation.designer.ipynb
Implantar e executar o pacote com a CLI do Databricks:
databricks bundle deploy
databricks bundle run daily_prep_job
Para o conjunto completo de chaves de tarefa de notebook, consulte Tarefa de Notebook. Para uma orientação completa sobre como definir um Job em um pacote, consulte Desenvolva um Job com Pacotes de Automação Declarativa.
Automatize com CI/CD
Para validar e implantar bundles de preparação de dados visuais automaticamente, integre-os a um pipeline de CI/CD. Para um exemplo usando GitHub Actions, consulte GitHub Actions.