Crie seu primeiro fluxo de trabalho com LakeFlow Jobs
Orquestrar tarefas com Jobs do Lakeflow para ler e processar um dataset de amostra. Neste início rápido, o usuário:
- Crie um novo notebook e adicione código para ler um dataset de amostra de reservas de propriedades.
- Salve o dataset no Unity Catalog.
- Crie um novo Notebook e adicione um código para ler o site dataset de Unity Catalog, filtrá-lo por ano e exibir os resultados.
- Cria um novo job e configura duas tarefas utilizando os notebooks.
- Execute o job e veja os resultados.
Requisitos
Este guia de início rápido lê a partir de samples.wanderbricks.bookings, que está disponível em todos os workspaces habilitados para Unity Catalog, portanto, não há dados de origem para configurar. Para gravar a tabela que o segundo notebook lê, você precisa de permissão para criar um esquema em um catálogo (os privilégios USE CATALOG e CREATE SCHEMA).
Para definir essas permissões, consulte a Databricks Unity Catalog documentação de privilégios do administrador ou .
Criar Notebook
Os passos a seguir criam dois Notebook para execução nesse fluxo de trabalho.
Recupere e salve dados
Para criar um notebook que lê o dataset de amostra e o salva no Unity Catalog:
-
Clique em
New na barra lateral e, em seguida, clique em Notebook . Databricks cria e abre um Notebook novo e em branco na pasta default. O idioma default é o idioma usado mais recentemente, e o Notebook é automaticamente anexado ao recurso compute usado mais recentemente.
-
(Opcional) Renomeie o notebook Retrieve booking data .
-
Se necessário, altere o idioma default para Python.
-
Copie o código Python a seguir e cole-o na primeira célula do notebook. Antes de executá-lo, verifique se
catalogeschemaapontam para um local no qual você pode gravar. O código cria o esquema se ele não existir.Pythoncatalog = "main"
schema = "example_output"
spark.sql(f"CREATE SCHEMA IF NOT EXISTS {catalog}.{schema}")
bookings = spark.read.table("samples.wanderbricks.bookings")
bookings.write.mode("overwrite").saveAsTable(f"{catalog}.{schema}.bookings")
Leia e exiba dados filtrados
Para criar um Notebook que filtre e exiba seus dados:
-
Clique em
New na barra lateral e, em seguida, clique em Notebook .
-
(Opcional) Renomeie o notebook Filter booking data .
-
O código Python a seguir lê a tabela que você salvou no passo anterior e cria uma view temporária. Ele também cria um widget que você pode usar para filtrar os dados na view pelo ano de check-in. Use os mesmos valores de
catalogeschemaque você usou no primeiro notebook.Pythonfrom pyspark.sql.functions import year
catalog = "main"
schema = "example_output"
bookings = spark.read.table(f"{catalog}.{schema}.bookings")
bookings.createOrReplaceTempView("bookings_table")
years = spark.sql("SELECT DISTINCT year(check_in) AS year FROM bookings_table").toPandas()["year"].tolist()
years.sort()
dbutils.widgets.dropdown("year", "2025", [str(x) for x in years])
display(bookings.filter(year(bookings.check_in) == dbutils.widgets.get("year")))
Criar um trabalho
O trabalho que o senhor está criando consiste em duas tarefas.
Para criar a primeira tarefa:
- Em seu site workspace, clique em
Jobs & pipeline na barra lateral.
- Clique em Create e depois em Job .
- Clique no bloco Bloco Notebook para configurar a primeira tarefa. Se o bloco Bloco Notebook não estiver disponível, clique em Adicionar outro tipo de tarefa e pesquise por Notebook .
- (Opcional) Substitua o nome do Job, cujo padrão é
New Job <date-time>pelo seu nome de trabalho. - No campo Nome da tarefa , insira um nome para a tarefa; por exemplo, recuperar-reservas .
- Se necessário, selecione Notebook no menu suspenso Type (Tipo ).
- No menu suspenso Source (Fonte ), selecione workspace (espaço de trabalho ), o que lhe permite usar um Notebook salvo anteriormente.
- Para Path , use o navegador de arquivos para localizar o primeiro Notebook que o senhor criou, clique no nome do Notebook e clique em Confirm (Confirmar ).
- Clique em Salvar tarefa . Uma notificação aparece no canto superior direito da tela.
Para criar a segunda tarefa:
- Clique
em **Adicionar tarefa** > **Notebook**.
- No campo Nome da tarefa , insira um nome para a tarefa; por exemplo, filtrar-reservas .
- Para Path (Caminho ), use o navegador de arquivos para localizar o segundo Notebook que o senhor criou, clique no nome do Notebook e clique em Confirm (Confirmar ).
- Clique em Adicionar em Parâmetros . No campo Chave , digite
year. No campo Valor , digite2025. - Clique em Salvar tarefa .
execução do trabalho
Para executar o trabalho imediatamente, clique em no canto superior direito.
ver detalhes da execução
-
Clique na execução tab e clique no link na coluna começar time para abrir a execução que o senhor deseja view.
-
Clique em qualquer tarefa para ver o resultado e os detalhes. Por exemplo, clique na tarefa filter-bookings para ver a saída e os detalhes da execução da tarefa de filtro:

execução com diferentes parâmetros
Para executar novamente o job e filtrar reservas de outro ano:
- Clique em
ao lado de executar agora e selecione executar agora com configurações diferentes .
- No campo Valor , digite
2024. - Clique em Executar .
Recursos adicionais
- Configure as configurações de Job, como programar, notificações e parâmetros. Consulte Configurar e editar Jobs do LakeFlow.
- Explore os tipos de tarefa disponíveis. Consulte Tipos de tarefas.
- Realize a execução de Job automaticamente conforme programar ou quando novos dados chegam. Consulte Automatizar Jobs com programar e acionadores.
- Monitore execuções de jobs e configure alertas. Consulte Monitorar Jobs do Lakeflow.