Pular para o conteúdo principal

Crie seu primeiro fluxo de trabalho com LakeFlow Jobs

Orquestrar tarefas com Jobs do Lakeflow para ler e processar um dataset de amostra. Neste início rápido, o usuário:

  1. Crie um novo notebook e adicione código para ler um dataset de amostra de reservas de propriedades.
  2. Salve o dataset no Unity Catalog.
  3. Crie um novo Notebook e adicione um código para ler o site dataset de Unity Catalog, filtrá-lo por ano e exibir os resultados.
  4. Cria um novo job e configura duas tarefas utilizando os notebooks.
  5. Execute o job e veja os resultados.

Requisitos

Este guia de início rápido lê a partir de samples.wanderbricks.bookings, que está disponível em todos os workspaces habilitados para Unity Catalog, portanto, não há dados de origem para configurar. Para gravar a tabela que o segundo notebook lê, você precisa de permissão para criar um esquema em um catálogo (os privilégios USE CATALOG e CREATE SCHEMA).

Para definir essas permissões, consulte a Databricks Unity Catalog documentação de privilégios do administrador ou .

Criar Notebook

Os passos a seguir criam dois Notebook para execução nesse fluxo de trabalho.

Recupere e salve dados

Para criar um notebook que lê o dataset de amostra e o salva no Unity Catalog:

  1. Clique em Novo ícone New na barra lateral e, em seguida, clique em Notebook . Databricks cria e abre um Notebook novo e em branco na pasta default. O idioma default é o idioma usado mais recentemente, e o Notebook é automaticamente anexado ao recurso compute usado mais recentemente.

  2. (Opcional) Renomeie o notebook Retrieve booking data .

  3. Se necessário, altere o idioma default para Python.

  4. Copie o código Python a seguir e cole-o na primeira célula do notebook. Antes de executá-lo, verifique se catalog e schema apontam para um local no qual você pode gravar. O código cria o esquema se ele não existir.

    Python
    catalog = "main"
    schema = "example_output"

    spark.sql(f"CREATE SCHEMA IF NOT EXISTS {catalog}.{schema}")

    bookings = spark.read.table("samples.wanderbricks.bookings")
    bookings.write.mode("overwrite").saveAsTable(f"{catalog}.{schema}.bookings")

Leia e exiba dados filtrados

Para criar um Notebook que filtre e exiba seus dados:

  1. Clique em Novo ícone New na barra lateral e, em seguida, clique em Notebook .

  2. (Opcional) Renomeie o notebook Filter booking data .

  3. O código Python a seguir lê a tabela que você salvou no passo anterior e cria uma view temporária. Ele também cria um widget que você pode usar para filtrar os dados na view pelo ano de check-in. Use os mesmos valores de catalog e schema que você usou no primeiro notebook.

    Python
    from pyspark.sql.functions import year

    catalog = "main"
    schema = "example_output"

    bookings = spark.read.table(f"{catalog}.{schema}.bookings")
    bookings.createOrReplaceTempView("bookings_table")
    years = spark.sql("SELECT DISTINCT year(check_in) AS year FROM bookings_table").toPandas()["year"].tolist()
    years.sort()
    dbutils.widgets.dropdown("year", "2025", [str(x) for x in years])
    display(bookings.filter(year(bookings.check_in) == dbutils.widgets.get("year")))

Criar um trabalho

O trabalho que o senhor está criando consiste em duas tarefas.

Para criar a primeira tarefa:

  1. Em seu site workspace, clique em ícone de fluxo de trabalho. Jobs & pipeline na barra lateral.
  2. Clique em Create e depois em Job .
  3. Clique no bloco Bloco Notebook para configurar a primeira tarefa. Se o bloco Bloco Notebook não estiver disponível, clique em Adicionar outro tipo de tarefa e pesquise por Notebook .
  4. (Opcional) Substitua o nome do Job, cujo padrão é New Job <date-time> pelo seu nome de trabalho.
  5. No campo Nome da tarefa , insira um nome para a tarefa; por exemplo, recuperar-reservas .
  6. Se necessário, selecione Notebook no menu suspenso Type (Tipo ).
  7. No menu suspenso Source (Fonte ), selecione workspace (espaço de trabalho ), o que lhe permite usar um Notebook salvo anteriormente.
  8. Para Path , use o navegador de arquivos para localizar o primeiro Notebook que o senhor criou, clique no nome do Notebook e clique em Confirm (Confirmar ).
  9. Clique em Salvar tarefa . Uma notificação aparece no canto superior direito da tela.

Para criar a segunda tarefa:

  1. Clique Ícone de mais. em **Adicionar tarefa** > **Notebook**.
  2. No campo Nome da tarefa , insira um nome para a tarefa; por exemplo, filtrar-reservas .
  3. Para Path (Caminho ), use o navegador de arquivos para localizar o segundo Notebook que o senhor criou, clique no nome do Notebook e clique em Confirm (Confirmar ).
  4. Clique em Adicionar em Parâmetros . No campo Chave , digite year. No campo Valor , digite 2025.
  5. Clique em Salvar tarefa .

execução do trabalho

Para executar o trabalho imediatamente, clique em Botão executar agora no canto superior direito.

ver detalhes da execução

  1. Clique na execução tab e clique no link na coluna começar time para abrir a execução que o senhor deseja view.

  2. Clique em qualquer tarefa para ver o resultado e os detalhes. Por exemplo, clique na tarefa filter-bookings para ver a saída e os detalhes da execução da tarefa de filtro:

    Exibir resultados de filtros de reservas

execução com diferentes parâmetros

Para executar novamente o job e filtrar reservas de outro ano:

  1. Clique em Seta azul para baixo ao lado de executar agora e selecione executar agora com configurações diferentes .
  2. No campo Valor , digite 2024.
  3. Clique em Executar .

Recursos adicionais