Créer votre premier workflow avec Lakeflow Jobs
Orchestrer des tâches avec Lakeflow Jobs pour lire et traiter un dataset d'exemple. Dans ce démarrage rapide, vous :
- Créez un nouveau notebook et ajoutez du code pour lire un dataset d'exemple de réservations de propriétés.
- Enregistrez le dataset dans Unity Catalog.
- Créez un nouveau notebook et ajoutez du code pour lire le dataset depuis Unity Catalog, filtrez-le par année et affichez les résultats.
- Créez un nouveau job et configurez deux tâches à l’aide des notebooks.
- Exécutez le job et consultez les résultats.
Exigences
Si votre Workspace est compatible avec Unity Catalog et que Serverless Jobs est activé, by default, le Job s’exécute sur Serverless compute. Vous n’avez pas besoin d’autorisation de création de cluster pour exécuter votre job avec Serverless compute.
Autrement, vous devez disposer d'autorisation de création de cluster pour créer un compute de Job ou d'autorisations pour les ressources de compute tout usage.
Ce guide de démarrage rapide lit à partir de samples.wanderbricks.bookings, qui est disponible dans chaque workspace activé pour Unity Catalog ; il n’y a donc aucune donnée source à configurer. Pour écrire la table que le second notebook lit, vous avez besoin de l’autorisation de créer un schéma dans un catalogue (les privilèges USE CATALOG et CREATE SCHEMA).
Pour définir ces autorisations, consultez votre administrateur Databricks ou la référence des privilèges Unity Catalog.
Créer des notebooks
Les étapes suivantes créent deux Notebooks à exécuter dans ce workflow.
Récupérer et enregistrer les données
Pour créer un notebook qui lit le dataset d'exemple et l'enregistre dans Unity Catalog :
-
Cliquez sur
Nouveau dans la barre latérale, puis cliquez sur Notebook . Databricks crée et ouvre un nouveau Notebook vierge dans votre dossier default. La langue default est la langue que vous avez utilisée le plus récemment, et le Notebook est automatiquement attaché à la ressource de compute que vous avez utilisée le plus récemment.
-
(Facultatif) Renommez le notebook Retrieve booking data .
-
Si nécessaire, changez le langage par default en Python.
-
Copiez le code Python suivant et collez-le dans la première cellule du notebook. Avant de l'exécuter, vérifiez que
catalogetschemapointent vers un emplacement sur lequel vous pouvez écrire. Le code crée le schéma s’il n’existe pas.Pythoncatalog = "main"
schema = "example_output"
spark.sql(f"CREATE SCHEMA IF NOT EXISTS {catalog}.{schema}")
bookings = spark.read.table("samples.wanderbricks.bookings")
bookings.write.mode("overwrite").saveAsTable(f"{catalog}.{schema}.bookings")
Lisez et affichez les données filtrées
Pour créer un notebook qui filtre et affiche vos données :
-
Cliquez sur
Nouveau dans la barre latérale, puis cliquez sur Notebook .
-
(Facultatif) Renommez le notebook Filter booking data .
-
Le code Python suivant lit la table que vous avez enregistrée à l’étape précédente et crée une vue temporaire. Il crée également un widget que vous pouvez utiliser pour filtrer les données de la vue par année d’enregistrement. Utilisez les mêmes valeurs
catalogetschemaque celles utilisées dans le premier notebook.Pythonfrom pyspark.sql.functions import year
catalog = "main"
schema = "example_output"
bookings = spark.read.table(f"{catalog}.{schema}.bookings")
bookings.createOrReplaceTempView("bookings_table")
years = spark.sql("SELECT DISTINCT year(check_in) AS year FROM bookings_table").toPandas()["year"].tolist()
years.sort()
dbutils.widgets.dropdown("year", "2025", [str(x) for x in years])
display(bookings.filter(year(bookings.check_in) == dbutils.widgets.get("year")))
Créer un Job
Le Job que vous créez comporte deux tâches.
Pour créer la première tâche :
- Dans votre Workspace, cliquez
sur **Tâches et pipelines** dans la barre latérale.
- Cliquez sur Créer , puis sur Job .
- Cliquez sur la vignette Notebook pour configurer la première tâche. Si la vignette Notebook n'est pas disponible, cliquez sur Ajouter un autre type de tâche et recherchez Notebook .
- (Facultatif) Remplacez le nom du job, qui est
New Job <date-time>default, par le nom de votre job. - Dans le champ Nom de la tâche , saisissez un nom pour la tâche ; par exemple, retrieve-bookings .
- Si nécessaire, sélectionnez Notebook dans le menu déroulant Type .
- Dans le menu déroulant Source , sélectionnez Workspace , qui vous permet d'utiliser un Notebook que vous avez enregistré précédemment.
- Pour Chemin, utilisez l'explorateur de fichiers pour trouver le premier Notebook que vous avez créé, cliquez sur le nom du Notebook, puis cliquez sur Confirmer.
- Cliquez sur **Enregistrer la tâche**. Une notification apparaît dans le coin supérieur droit de l'écran.
Pour créer la 2e tâche :
- Cliquez sur
Ajouter une tâche > Notebook .
- Dans le champ Nom de la tâche , saisissez un nom pour la tâche ; par exemple, filter-bookings .
- Pour Path , utilisez le navigateur de fichiers pour trouver le deuxième Notebook que vous avez créé, cliquez sur le nom du Notebook, puis cliquez sur Confirm .
- Click Add under parameter . Dans le champ Clé , saisissez
year. Dans le champ Valeur , saisissez2025. - Cliquez sur Enregistrer la tâche .
Exécuter le job
Pour exécuter le Job immédiatement, cliquez sur dans le coin supérieur droit.
Afficher les détails de l'exécution
-
Cliquez sur le Runs tab et cliquez sur le Link dans la colonne start time pour ouvrir l'exécution que vous souhaitez afficher.
-
Cliquez sur l’une ou l’autre des tâches pour voir la sortie et les détails. Par exemple, cliquez sur la tâche filter-bookings pour afficher la sortie et les détails d’exécution de la tâche de filtrage :

Exécuter avec d'autres paramètres
Pour réexécuter le job et filtrer les réservations pour une année différente :
- Cliquez
sur à côté de **Exécuter maintenant** et sélectionnez **Exécuter maintenant avec des paramètres différents**.
- Dans le champ Valeur , entrez
2024. - Cliquez sur Exécuter .
Ressources supplémentaires
- Configurez les paramètres du Job, tels que les planifications, les notifications et les parameters. Consultez Configurer et modifier les Lakeflow Jobs.
- Explorez les types de tâches disponibles. Voir Types de tâches.
- Exécutez automatiquement des jobs selon un calendrier ou lorsque de nouvelles données arrivent. Voir Automatiser les Job avec des planifications et des Trigger.
- Surveiller les exécutions de Job et configurer des alertes. Consultez Surveiller les Lakeflow Jobs.