Aller au contenu principal

Créer votre premier workflow avec Lakeflow Jobs

Orchestrer des tâches avec Lakeflow Jobs pour lire et traiter un dataset d'exemple. Dans ce démarrage rapide, vous :

  1. Créez un nouveau notebook et ajoutez du code pour lire un dataset d'exemple de réservations de propriétés.
  2. Enregistrez le dataset dans Unity Catalog.
  3. Créez un nouveau notebook et ajoutez du code pour lire le dataset depuis Unity Catalog, filtrez-le par année et affichez les résultats.
  4. Créez un nouveau job et configurez deux tâches à l’aide des notebooks.
  5. Exécutez le job et consultez les résultats.

Exigences

Si votre Workspace est compatible avec Unity Catalog et que Serverless Jobs est activé, by default, le Job s’exécute sur Serverless compute. Vous n’avez pas besoin d’autorisation de création de cluster pour exécuter votre job avec Serverless compute.

Autrement, vous devez disposer d'autorisation de création de cluster pour créer un compute de Job ou d'autorisations pour les ressources de compute tout usage.

Ce guide de démarrage rapide lit à partir de samples.wanderbricks.bookings, qui est disponible dans chaque workspace activé pour Unity Catalog ; il n’y a donc aucune donnée source à configurer. Pour écrire la table que le second notebook lit, vous avez besoin de l’autorisation de créer un schéma dans un catalogue (les privilèges USE CATALOG et CREATE SCHEMA).

Pour définir ces autorisations, consultez votre administrateur Databricks ou la référence des privilèges Unity Catalog.

Créer des notebooks

Les étapes suivantes créent deux Notebooks à exécuter dans ce workflow.

Récupérer et enregistrer les données

Pour créer un notebook qui lit le dataset d'exemple et l'enregistre dans Unity Catalog :

  1. Cliquez sur Nouvelle icône Nouveau dans la barre latérale, puis cliquez sur Notebook . Databricks crée et ouvre un nouveau Notebook vierge dans votre dossier default. La langue default est la langue que vous avez utilisée le plus récemment, et le Notebook est automatiquement attaché à la ressource de compute que vous avez utilisée le plus récemment.

  2. (Facultatif) Renommez le notebook Retrieve booking data .

  3. Si nécessaire, changez le langage par default en Python.

  4. Copiez le code Python suivant et collez-le dans la première cellule du notebook. Avant de l'exécuter, vérifiez que catalog et schema pointent vers un emplacement sur lequel vous pouvez écrire. Le code crée le schéma s’il n’existe pas.

    Python
    catalog = "main"
    schema = "example_output"

    spark.sql(f"CREATE SCHEMA IF NOT EXISTS {catalog}.{schema}")

    bookings = spark.read.table("samples.wanderbricks.bookings")
    bookings.write.mode("overwrite").saveAsTable(f"{catalog}.{schema}.bookings")

Lisez et affichez les données filtrées

Pour créer un notebook qui filtre et affiche vos données :

  1. Cliquez sur Nouvelle icône Nouveau dans la barre latérale, puis cliquez sur Notebook .

  2. (Facultatif) Renommez le notebook Filter booking data .

  3. Le code Python suivant lit la table que vous avez enregistrée à l’étape précédente et crée une vue temporaire. Il crée également un widget que vous pouvez utiliser pour filtrer les données de la vue par année d’enregistrement. Utilisez les mêmes valeurs catalog et schema que celles utilisées dans le premier notebook.

    Python
    from pyspark.sql.functions import year

    catalog = "main"
    schema = "example_output"

    bookings = spark.read.table(f"{catalog}.{schema}.bookings")
    bookings.createOrReplaceTempView("bookings_table")
    years = spark.sql("SELECT DISTINCT year(check_in) AS year FROM bookings_table").toPandas()["year"].tolist()
    years.sort()
    dbutils.widgets.dropdown("year", "2025", [str(x) for x in years])
    display(bookings.filter(year(bookings.check_in) == dbutils.widgets.get("year")))

Créer un Job

Le Job que vous créez comporte deux tâches.

Pour créer la première tâche :

  1. Dans votre Workspace, cliquez Icône Workflows. sur **Tâches et pipelines** dans la barre latérale.
  2. Cliquez sur Créer , puis sur Job .
  3. Cliquez sur la vignette Notebook pour configurer la première tâche. Si la vignette Notebook n'est pas disponible, cliquez sur Ajouter un autre type de tâche et recherchez Notebook .
  4. (Facultatif) Remplacez le nom du job, qui est New Job <date-time> default, par le nom de votre job.
  5. Dans le champ Nom de la tâche , saisissez un nom pour la tâche ; par exemple, retrieve-bookings .
  6. Si nécessaire, sélectionnez Notebook dans le menu déroulant Type .
  7. Dans le menu déroulant Source , sélectionnez Workspace , qui vous permet d'utiliser un Notebook que vous avez enregistré précédemment.
  8. Pour Chemin, utilisez l'explorateur de fichiers pour trouver le premier Notebook que vous avez créé, cliquez sur le nom du Notebook, puis cliquez sur Confirmer.
  9. Cliquez sur **Enregistrer la tâche**. Une notification apparaît dans le coin supérieur droit de l'écran.

Pour créer la 2e tâche :

  1. Cliquez sur Icône Plus. Ajouter une tâche > Notebook .
  2. Dans le champ Nom de la tâche , saisissez un nom pour la tâche ; par exemple, filter-bookings .
  3. Pour Path , utilisez le navigateur de fichiers pour trouver le deuxième Notebook que vous avez créé, cliquez sur le nom du Notebook, puis cliquez sur Confirm .
  4. Click Add under parameter . Dans le champ Clé , saisissez year. Dans le champ Valeur , saisissez 2025.
  5. Cliquez sur Enregistrer la tâche .

Exécuter le job

Pour exécuter le Job immédiatement, cliquez sur Bouton Exécuter maintenant dans le coin supérieur droit.

Afficher les détails de l'exécution

  1. Cliquez sur le Runs tab et cliquez sur le Link dans la colonne start time pour ouvrir l'exécution que vous souhaitez afficher.

  2. Cliquez sur l’une ou l’autre des tâches pour voir la sortie et les détails. Par exemple, cliquez sur la tâche filter-bookings pour afficher la sortie et les détails d’exécution de la tâche de filtrage :

    Afficher les résultats du filtre de réservations

Exécuter avec d'autres paramètres

Pour réexécuter le job et filtrer les réservations pour une année différente :

  1. Cliquez Flèche vers le bas bleue sur à côté de **Exécuter maintenant** et sélectionnez **Exécuter maintenant avec des paramètres différents**.
  2. Dans le champ Valeur , entrez 2024.
  3. Cliquez sur Exécuter .

Ressources supplémentaires