Développez et déboguez les pipelines ETL avec l'éditeur de LakeFlow Pipelines.
Vous développez et déboguez des pipelines ETL (extraction, transformation et chargement) dans l'éditeur de Lakeflow Pipelines, un IDE conçu pour le développement de pipelines.
Qu'est-ce que l'éditeur LakeFlow Pipelines ?
L'éditeur de LakeFlow Pipelines est un IDE conçu pour le développement de pipelines. Il combine toutes les tâches de développement de pipeline sur une seule interface, prenant en charge les workflows code-first, l'organisation du code basée sur des dossiers, l'exécution sélective, les aperçus de données et les graphes de pipeline. Intégré à la plateforme Databricks, il permet également le contrôle de version, les révisions de code et les exécutions planifiées.
Présentation de l’interface utilisateur de l’éditeur de LakeFlow Pipelines
L'image suivante montre l'éditeur de LakeFlow Pipelines :

L'image montre les fonctionnalités suivantes :
- **Navigateur d’assets de pipeline** : créez, supprimez, renommez et organisez les assets de pipeline. Inclut également des raccourcis vers la configuration du pipeline.
- Éditeur de code multifichier avec onglets: travaillez sur plusieurs fichiers de code associés à un pipeline.
- Barre d'outils spécifique au pipeline : inclut les options de configuration du pipeline et propose des actions d'exécution au niveau du pipeline.
- Graphe de pipeline interactif: obtenez un aperçu de vos tables, ouvrez la barre inférieure d'aperçus des données et effectuez d'autres actions liées aux tables.
- Aperçus de l'exécution au niveau de la table: Obtenez des aperçus de l'exécution pour toutes les tables ou une seule table dans un pipeline. Les insights font référence à la dernière exécution du pipeline.
- Panneau Problèmes: Cette fonctionnalité résume les erreurs, les avertissements et les insights dans tous les fichiers du pipeline, et vous permet de naviguer vers l'emplacement de l'erreur dans un fichier spécifique. Il complète les indicateurs d'erreur intégrés au code.
- Exécution sélective: l'éditeur de code offre des fonctionnalités pour un développement pas à pas, comme la possibilité d'refresh uniquement les tableaux du fichier actuel à l'aide de l'action Exécuter le fichier , ou d'refresh un seul tableau.
Genie Code: créez, mettez à jour et déboguez vos pipelines à l'aide de Genie Code, une expérience agentique qui automatise les workflows multi-étapes, de la découverte des données et de la génération de code à l'exécution de pipelines et à la résolution des problèmes de qualité des données.
Autres fonctionnalités importantes :
- Aperçu des données: inspectez les données de vos tables de streaming et vues matérialisées.
- Structure de dossiers de pipeline default: Les nouveaux pipelines incluent une structure de dossiers prédéfinie et un exemple de code que vous pouvez utiliser comme point de départ pour votre pipeline.
Créez un nouveau pipeline ETL
Pour créer un nouveau pipeline ETL à l'aide de l'éditeur Lakeflow Pipelines, suivez ces étapes :
-
En haut de la barre latérale, cliquez sur
Nouveau , puis sélectionnez
pipeline ETL .
Un pipeline est créé automatiquement avec les paramètres default suivants :
Vous pouvez ajuster ces paramètres depuis la barre d’outils du pipeline.
-
En haut, donnez un nom unique à votre pipeline.
-
À côté du nom, le catalogue et le schéma default choisis pour vous sont affichés.
Le catalogue et le schéma default sont l’endroit où les datasets sont lus ou écrits lorsque vous ne qualifiez pas les datasets avec un catalogue ou un schéma dans votre code. Consultez les objets de base de données dans Databricks pour plus d'informations.
Cliquez sur le catalogue et le schéma pour modifier les defaults de votre pipeline.
-
Votre pipeline contient un fichier
my_transformationvide par default. Basculez ce fichier entre Python et SQL en choisissant dans la liste déroulante des langues. Écrivez du code directement dans ce fichier, ou choisissez l'une des options suivantes pour start rapidement :Créer avec Genie Code : Décrivez votre pipeline en langage naturel et laissez Genie Code le construire pour vous.
- Utiliser un exemple de code : Créez une arborescence de dossiers par default et un exemple de code dans la langue du fichier actuel.

Pour plus d'options avancées, développez le menu
(à droite du bouton
Utiliser un exemple de code ) pour :
- Ajouter du code source existant : associez votre pipeline à des fichiers de code déjà disponibles dans votre workspace, y compris les dossiers Git.
- **Configurer comme contrôlé par les sources** : Utilisez un projet Declarative Automation Bundles pour le contrôle de version et la prise en charge CI/CD. Consultez Créer un pipeline contrôlé par les sources.
- Utiliser Hive metastore : créez un pipeline avec les paramètres hérités.
Alternativement, vous pouvez créer un pipeline ETL depuis le navigateur de Workspace :
- Cliquez sur Workspace dans le panneau latéral gauche.
- Sélectionnez n'importe quel dossier, y compris les dossiers Git.
- Cliquez sur **Create** dans le coin supérieur droit, et sur **pipeline ETL**.
Vous pouvez également créer un pipeline ETL depuis la page des Jobs et pipelines :
- Dans votre Workspace, cliquez
sur **Tâches et pipelines** dans la barre latérale.
- Sous Nouveau , cliquez sur Pipeline ETL .
La CLI Databricks fournit des commandes pour créer, modifier et gérer vos pipelines à partir d’un terminal. Consultez le pipelines groupe de commandes.
Ouvrir un pipeline ETL existant
Il existe plusieurs façons d'ouvrir un pipeline ETL existant dans l'éditeur de LakeFlow Pipelines :
-
Ouvrez n'importe quel fichier source associé au pipeline :
- Cliquez sur Workspace dans le panneau latéral.
- Accédez à un dossier contenant les fichiers de code source de votre pipeline.
- Cliquez sur le fichier de code source pour ouvrir le pipeline dans l’éditeur.
-
Ouvrez un pipeline récemment modifié :
- Depuis l'éditeur, vous pouvez accéder à d'autres pipelines que vous avez récemment modifiés en cliquant sur le nom du pipeline en haut du navigateur d'assets et en choisissant un autre pipeline dans la liste des récents qui apparaît.
- En dehors de l’éditeur, depuis la page Récents dans la barre latérale gauche, ouvrez un pipeline ou un fichier configuré comme code source pour un pipeline.
-
Lorsque vous consultez un pipeline au sein du produit, vous pouvez choisir de modifier le pipeline :
- Dans la page de monitoring du pipeline, cliquez sur
Modifier le pipeline .
- Sur la page **Travaux et pipelines** dans la barre latérale gauche, cliquez
sur pour modifier le pipeline.
- Lorsque vous modifiez un Job et ajoutez une tâche de pipeline, vous pouvez cliquer sur le
bouton lorsque vous choisissez un pipeline sous **Pipeline**.
- Dans la page de monitoring du pipeline, cliquez sur
-
Si vous parcourez Tous les fichiers dans le navigateur d'assets et que vous ouvrez un fichier de code source d'un autre pipeline, une bannière s'affiche en haut de l'éditeur, vous invitant à ouvrir le pipeline associé.
Navigateur d’asset de pipeline
Lorsque vous modifiez un pipeline, la barre latérale gauche du workspace utilise un mode spécial appelé le navigateur d’assets du pipeline . By default, le navigateur d’assets du pipeline se concentre sur la racine du pipeline, ainsi que sur les dossiers et les fichiers situés dans la racine. Vous pouvez également choisir d’afficher Tous les fichiers pour voir les fichiers situés en dehors de la racine du pipeline. Les tabs ouvertes dans l’éditeur de pipeline lors de la modification d’un pipeline spécifique sont mémorisées, et lorsque vous passez à un autre pipeline, les tabs ouvertes la dernière fois que vous avez modifié ce pipeline sont restaurées.
L'éditeur dispose également de contextes pour la modification des fichiers SQL (appelé l' Éditeur Databricks SQL ) et d'un contexte général pour la modification des fichiers de Workspace qui ne sont ni des fichiers SQL ni des fichiers de pipeline. Chacun de ces contextes mémorise et restaure les tabs que vous aviez ouverts la dernière fois que vous avez utilisé ce contexte. Vous pouvez changer de contexte depuis le haut de la barre latérale gauche. Cliquez sur l'en-tête pour choisir entre le Workspace, l'éditeur SQL ou les pipelines récemment modifiés.

Lorsque vous ouvrez un fichier depuis la page du navigateur Workspace, il s'ouvre dans l'éditeur correspondant à ce fichier. Si le fichier est associé à un pipeline, il s'agit de l'éditeur de LakeFlow Pipelines.
Pour ouvrir un fichier qui ne fait pas partie du pipeline, tout en conservant le contexte du pipeline, ouvrez le fichier depuis l'onglet Tous les fichiers de l'explorateur d'assets.
Le navigateur d'asset de pipeline comporte deux tab :
- **Pipeline** : C'est ici que vous pouvez trouver tous les fichiers associés au pipeline. Vous pouvez les créer, les supprimer, les renommer et les organiser en dossiers. Ce tab comprend également des raccourcis pour la configuration du pipeline et une vue graphique des exécutions récentes.
- **Tous les fichiers** : Tous les autres assets du Workspace sont disponibles ici. Ceci peut être utile pour trouver des fichiers à ajouter au pipeline ou pour afficher d'autres fichiers liés au pipeline, comme un fichier YAML qui définit un Declarative Automation Bundles.

Vous pouvez avoir les types de fichiers suivants dans votre pipeline :
- Fichiers de code source: ces fichiers font partie de la définition du code source du pipeline, que vous pouvez consulter dans Paramètres . Databricks recommande de toujours stocker les fichiers de code source dans le dossier racine du pipeline; sinon, ils sont affichés dans une section fichier externe en bas du navigateur et ont un ensemble de fonctionnalités moins riche.
- Fichiers non liés au code source: Ces fichiers sont stockés dans le dossier racine du pipeline, mais ne font pas partie de la définition du code source du pipeline.
Vous devez utiliser le navigateur d'assets de pipeline sous l'onglet **Pipeline** pour gérer les fichiers et les dossiers de votre pipeline. Cela met à jour correctement les paramètres du pipeline. Le déplacement ou le renommage de fichiers et de dossiers depuis votre navigateur de Workspace ou l'onglet **All files** interrompt la configuration du pipeline, et vous devez ensuite résoudre cela manuellement dans les **Paramètres**.
Dossier racine
Le navigateur d'assets de pipeline est ancré dans un dossier racine de pipeline. Lorsque vous créez un nouveau pipeline, le dossier racine du pipeline est créé dans votre dossier personnel d'utilisateur.
Vous pouvez modifier le dossier racine dans le navigateur d'assets de pipeline. Ceci est utile si vous avez créé un pipeline dans un dossier et que vous souhaitez ensuite tout déplacer vers un autre dossier. Par exemple, vous avez créé le pipeline dans un dossier normal et souhaitez déplacer le code source vers un dossier Git pour le contrôle de version.
- Cliquez sur le menu long
pour le dossier racine.
- Cliquez sur Configurer le nouveau dossier racine .
- Sous **Dossier racine du
pipeline**, cliquez sur et choisissez un autre dossier comme dossier racine du pipeline.
- Cliquez sur Enregistrer .

Dans la pour le dossier racine, vous pouvez également cliquer sur Renommer le dossier racine pour renommer le dossier. Ici, vous pouvez également cliquer sur **Déplacer le dossier racine** pour déplacer le dossier racine, par exemple, dans un dossier Git.
Vous pouvez également modifier le dossier racine du pipeline dans les paramètres :
- Cliquez sur Paramètres .
- Sous assets de code , cliquez sur Configurer les chemins d'accès .
- Cliquez sur
pour modifier le dossier sous Dossier racine du pipeline .
- Cliquez sur Enregistrer .
Si vous modifiez le dossier racine du pipeline, la liste des fichiers affichée par l’explorateur d’asset du pipeline est affectée, car les fichiers du précédent dossier racine s’affichent comme fichiers externes.
Pipeline existant sans dossier racine
Un pipeline existant créé à l'aide de l'expérience d'édition de Notebook classique n'aura pas de dossier racine configuré. Lorsque vous ouvrez un pipeline qui n'a pas de dossier racine configuré, si vous souhaitez configurer le dossier racine pour votre pipeline, suivez ces étapes :
- Dans le navigateur d'asset de pipeline, cliquez sur Configurer .
- Cliquez sur
pour sélectionner le dossier racine sous Dossier racine du pipeline .
- Cliquez sur Enregistrer .

Structure de dossiers default
Lorsque vous créez un nouveau pipeline, une structure de dossiers default est créée. Voici la structure recommandée pour organiser les fichiers de code source et non source de votre pipeline, comme décrit ci-dessous.
Un petit nombre de fichiers de code d'exemple sont créés dans cette structure de dossiers.
Nom du dossier | Emplacement recommandé pour ces types de fichiers |
|---|---|
| Dossier racine qui contient tous les dossiers et fichiers de votre pipeline. |
| Fichiers de code source, tels que des fichiers de code Python ou SQL avec des définitions de table. |
| Fichiers non-code source, tels que les Notebooks, les queries et les fichiers de code utilisés pour l'analyse exploratoire des données. |
| Fichiers non-code source avec des modules Python qui peuvent être importés à partir d'autres fichiers de code. Si vous choisissez SQL comme langage pour le code d'exemple, ce dossier n'est pas créé. |
Vous pouvez renommer les noms de dossiers ou modifier la structure pour l'adapter à votre workflow. Pour ajouter un nouveau dossier de code source, veuillez suivre ces étapes.
- Cliquez sur Ajouter dans le navigateur d'actifs de pipeline.
- Cliquez sur Créer un dossier de code source de pipeline .
- Saisissez un nom de dossier et cliquez sur Créer .
Fichiers de code source
Les fichiers de code source font partie de la définition du code source du pipeline. Lorsque vous exécutez le pipeline, ces fichiers sont évalués. Les fichiers et dossiers faisant partie de la définition du code source ont une icône spéciale avec une mini-icône de pipeline superposée.
Pour ajouter un nouveau fichier de code source :
- Cliquez sur
à côté du dossier racine.
- Click Transformations .
- Saisissez un Nom pour le fichier et sélectionnez Python ou SQL comme Langage .
- Cliquez sur Créer .
Utilisez les aides en ligne pour start à écrire du code avec Genie Code ou pour générer de courts extraits de code pour le type de dataset souhaité (par exemple, vue matérialisée ou table de streaming).
Un dossier transformations pour le code source est créé par default lorsque vous créez un nouveau pipeline. Ce dossier est l'emplacement recommandé pour le code source du pipeline, tels que les fichiers de code Python ou SQL avec des définitions de table de pipeline.
Fichiers non liés au code source
Les fichiers non liés au code source sont stockés dans le dossier racine du pipeline, mais ne font pas partie de la définition du code source du pipeline. Ces fichiers ne sont pas évalués lorsque vous exécutez le pipeline. Les fichiers non liés au code source ne peuvent pas être des fichiers externes.
Vous pouvez l'utiliser pour les fichiers liés à votre travail sur le pipeline que vous souhaitez stocker avec le code source. Par exemple :
- Notebooks que vous utilisez pour des explorations ad hoc exécutées sur des ressources de compute en dehors du cycle de vie d'un pipeline.
- Modules Python qui ne doivent pas être évalués avec votre code source, sauf si vous importez explicitement ces modules dans vos fichiers de code source.
Pour ajouter un nouveau fichier sans code source :
- Cliquez sur
à côté du dossier racine.
- Click Exploration or infrastructures publiques .
- Saisissez un nom pour le fichier.
- Cliquez sur Créer .
Lorsque vous créez un nouveau pipeline, les dossiers suivants pour les fichiers non-code source sont créés par default :
Nom du dossier | Description |
|---|---|
| Ce dossier est l'emplacement recommandé pour les notebooks, les queries, les tableaux de bord et autres fichiers, que vous pouvez ensuite exécuter sur un compute, comme vous le feriez normalement en dehors du cycle de vie d'exécution d'un pipeline. |
| Ce dossier est l'emplacement recommandé pour les modules Python qui peuvent être importés à partir d'autres fichiers via des imports directs exprimés en tant que |
Vous pouvez également importer des modules Python situés en dehors du dossier racine, mais dans ce cas, vous devez ajouter le chemin du dossier à sys.path dans votre code Python :
import sys, os
sys.path.append(os.path.abspath('<alternate_path_for_utilities>/utilities'))
from utils import \*
Fichiers externes
La section Fichiers externes du navigateur de pipeline affiche les fichiers de code source en dehors du dossier racine.
Pour déplacer un fichier externe vers le dossier racine, tel que le dossier transformations, suivez ces étapes :
- Cliquez sur
pour le fichier dans l'explorateur de ressources et cliquez sur Déplacer .
- Choisissez le dossier vers lequel vous souhaitez déplacer le fichier et cliquez sur Déplacer .
Fichiers associés à plusieurs pipelines
Un badge est affiché dans l'en-tête du fichier si un fichier est associé à plus d'un pipeline. Il affiche le nombre de pipelines associés et permet de basculer vers les autres.
Section Tous les fichiers
En plus de la section Pipeline , il y a une section Tous les fichiers , où vous pouvez ouvrir n'importe quel fichier dans votre Workspace. Ici, vous pouvez :
- Ouvrez les fichiers en dehors du dossier racine dans un tab sans quitter l'éditeur de LakeFlow Pipelines.
- Accédez aux fichiers de code source d’un autre pipeline et ouvrez-les. Cela ouvre le fichier dans l'éditeur et vous affiche une bannière avec l'option de basculer la mise au point dans l'éditeur vers ce second pipeline.
- Déplacez les fichiers vers le dossier racine du pipeline.
- Incluez les fichiers extérieurs au dossier racine dans la définition du code source du pipeline.
Modifier les fichiers sources du pipeline
Lorsque vous ouvrez un fichier source de pipeline à partir du navigateur de Workspace, ou du navigateur d'assets de pipeline, il s'ouvre dans un tab d'éditeur dans l'Éditeur de LakeFlow Pipelines. L'ouverture de plus de fichiers ouvre des onglets séparés, vous permettant de modifier plusieurs fichiers à la fois.
L'ouverture d'un fichier qui n'est associé à aucun pipeline depuis le navigateur de workspace ouvrira l'éditeur dans un autre contexte (soit l'éditeur général Workspace , soit, pour les fichiers SQL, l' SQL Editor ).
Lorsque vous ouvrez un fichier hors pipeline à partir de la All files tab du navigateur d'assets de pipeline, il s'ouvre dans un nouvel tab dans le contexte du pipeline.
Le code source du pipeline inclut plusieurs fichiers. By default, les fichiers source se trouvent dans le dossier **transformations** du navigateur d'asset de pipeline. Les fichiers de code source peuvent être des fichiers Python ( *.py ) ou SQL ( *.sql ). Votre source peut inclure un mélange de fichiers Python et SQL dans un seul pipeline, et le code d'un fichier peut référencer une table ou une vue définie dans un autre fichier.
Vous pouvez également inclure des fichiers Markdown (*.md*) dans votre dossier **transformations**. Les fichiers Markdown peuvent être utilisés pour la documentation ou les notes, mais sont ignorés lors de l'exécution d'une mise à jour de pipeline.
Les fonctionnalités suivantes sont spécifiques à l'éditeur de LakeFlow Pipelines :

-
Connecter : Connectez-vous à un compute serverless ou classique pour exécuter le pipeline. Tous les fichiers associés au pipeline utilisent la même connexion de compute, donc une fois que vous êtes connecté, vous n'avez pas besoin de vous connecter pour d'autres fichiers dans le même pipeline. Pour plus d'informations sur les options de compute, consultez les options de configuration du compute.
Pour les fichiers hors pipeline, tels qu'un Notebook exploratoire, l'option de connexion est disponible, mais ne s'applique qu'à ce fichier individuel.
-
Exécution du fichier : Exécutez le code pour mettre à jour les tables définies dans ce fichier source. La section suivante décrit les différentes façons d’exécuter votre code de pipeline.
-
Modifier : utilisez le
Genie Code pour modifier ou ajouter du code dans le fichier.
-
Correction rapide : utilisez
Genie Code pour corriger les erreurs ou agir sur les insights dans votre code.
Le panneau inférieur s'adapte également, en fonction de la tab actuelle. La consultation des informations de pipeline dans le panneau inférieur est toujours disponible. Les fichiers non associés au pipeline, tels que les fichiers d'éditeur SQL, affichent également leur sortie dans le panneau inférieur, dans un tab séparé. L'image suivante montre un sélecteur d'tab vertical pour basculer le panneau inférieur entre l'affichage des informations de pipeline ou des informations pour le Notebook sélectionné.

Exécuter le code du pipeline
Vous disposez de quatre options pour exécuter le code de votre pipeline :
-
Exécuter tous les fichiers de code source dans le pipeline
Cliquez sur Exécuter le pipeline ou Exécuter le pipeline avec un refresh complet de la table pour exécuter toutes les définitions de table dans tous les fichiers définis comme code source du pipeline. Pour plus de détails sur les types de refresh, consultez Sémantique de refresh de pipeline.
Vous pouvez également cliquer sur Simulation pour valider le pipeline sans mettre à jour aucune donnée.
-
Exécuter le code dans un seul fichier
Cliquez sur Exécuter le fichier ou Exécuter le fichier avec refresh complète de la table pour exécuter toutes les définitions de table dans le fichier actuel. Les autres fichiers du pipeline ne sont pas évalués.
Cette option est utile pour le debugging lors de l'édition et de l'itération rapides sur un fichier. L'exécution du code dans un seul fichier a des effets secondaires.
- Lorsque les autres fichiers ne sont pas évalués, les erreurs dans ces fichiers ne sont pas détectées.
- Les tables matérialisées dans d'autres fichiers utilisent la matérialisation la plus récente de la table, même s'il existe des données source plus récentes.
- Vous pourriez rencontrer des erreurs si une table référencée n'a pas encore été matérialisée.
- Le graphe du pipeline peut être incorrect ou disjoint pour les tables d’autres fichiers qui n’ont pas été matérialisées. Databricks fait de son mieux pour que le graphe reste correct, mais n'évalue pas d'autres fichiers pour ce faire.
Lorsque vous avez terminé le debugging et la modification d'un fichier, Databricks recommande d'exécuter tous les fichiers de code source du pipeline afin de vérifier que le pipeline fonctionne de bout en bout avant de le mettre en production.
-
Exécuter le code pour une seule table.
À côté de la définition d’une table dans le fichier de code source, cliquez sur l’**icône Exécuter la table**,
puis choisissez **Refresh table** ou **Full refresh table** dans le menu déroulant. L’exécution du code pour une seule table a des effets secondaires similaires à l’exécution du code dans un seul fichier.

L'exécution du code pour une seule table est disponible pour les tables de streaming et les vues matérialisées. Les sinks et les vues ne sont pas pris en charge.
-
Exécuter le code pour un ensemble de tables
Vous pouvez sélectionner des tables à partir du graphe du pipeline pour créer une liste de tables à exécuter. Passez la souris sur la table dans le Graphe du pipeline, cliquez sur
, et choisissez Sélectionner la table pour le refresh . Après avoir choisi les tables à refresh, sélectionnez l’option Exécuter ou Exécuter avec refresh complet en bas du Graphe du pipeline.

-
Exécuter le code sélectionné
Mettez en surbrillance le code SQL et cliquez sur Exécuter le code sélectionné pour inspecter rapidement les sorties sans matérialiser les données. Les sorties sont affichées dans l'onglet Résultats de la query dans le panneau inférieur.
Graphe du pipeline
Après avoir exécuté ou validé tous les fichiers de code source dans le pipeline, vous voyez le graphe du pipeline , également appelé graphe orienté acyclique (DAG). Le graphe affiche le graphe de dépendance de la table. Chaque nœud a différents états tout au long du cycle de vie du pipeline : validé, en cours d’exécution ou en erreur.

- Graphe du pipeline : ouvrez le graphe en cliquant sur l’onglet Graphe du pipeline dans le panneau inférieur.
- Nœuds : Affiche les dépendances des tables qui font partie de votre pipeline ainsi que toutes les métriques les concernant. Les nœuds qui font partie des fichiers actuellement ouverts sont mis en surbrillance dans le graphe du pipeline. Le survol d'un nœud affiche une barre d'outils avec des options, y compris refresh la query. Un clic droit sur un nœud vous donne les mêmes options dans un menu contextuel. Cliquer sur un nœud affiche l'aperçu des données et la définition de la table. Lorsque vous modifiez un fichier, les tables définies dans ce fichier sont mises en évidence dans le graphe.
- Ouvrir dans un tab : Pour agrandir le graphe, sélectionnez l'icône en haut à droite du panneau inférieur pour l'ouvrir dans un tab séparé.
- Plus d’options : Des options supplémentaires se trouvent en bas à droite, y compris les options de zoom et Plus d’options pour afficher le Graphe dans un Layout vertical ou horizontal.
Aperçus des données
La section d'aperçu des données affiche des exemples de données pour une table sélectionnée.
Vous voyez un aperçu des données de la table lorsque vous cliquez sur un nœud dans le graphe du pipeline. Pour accéder à l'aperçu des données d'une autre table directement dans le panneau inférieur, sélectionnez Retour au Graphe ou cliquez sur un autre nœud si le Graphe du pipeline est ouvert dans un tab séparé.
Vous pouvez également accéder à la section Tables et cliquer sur Afficher l'aperçu des données . Si vous avez choisi une table, cliquez sur Toutes les tables pour revenir à toutes les tables.
Lorsque vous prévisualisez les données de la table, vous pouvez filtrer ou trier les données sur place. Si vous souhaitez effectuer une analyse plus complexe, vous pouvez utiliser ou créer un Notebook dans le dossier Explorations (en supposant que vous ayez conservé la structure de dossier default). By default, le code source de ce dossier n'est pas exécuté lors d'une mise à jour du pipeline, vous pouvez donc créer des requêtes sans affecter la sortie du pipeline.
Insights d'exécution
Vous pouvez voir les aperçus de l'exécution de la table concernant la dernière mise à jour du pipeline dans les volets en bas de l'éditeur.
Panneau | Description |
|---|---|
Tables | Répertorie toutes les tables avec leurs statuts et métriques. Si vous sélectionnez une table, vous voyez les métriques et les performances pour cette table et un tab pour l'aperçu des données. Pour les vues matérialisées, la colonne Incrémentalisation indique comment la table a été actualisée et fournit des aperçus sur l'incrémentalisation. Voir les insights d'incriminalisation. |
Performance | Historique des query et profils pour tous les flux de ce pipeline. Vous pouvez accéder aux métriques d'exécution et aux plans de requête détaillés pendant et après l'exécution. Consultez l'historique des query pour les pipelines pour plus d'informations. |
Panneau des problèmes | Cliquez sur le panneau pour une vue simplifiée des erreurs, des avertissements et des insights pour le pipeline. Cliquez sur une entrée pour afficher plus de détails, puis accédez à l’emplacement dans le code où l’erreur s’est produite. Si l'erreur se trouve dans un fichier autre que celui actuellement affiché, cela vous redirige vers le fichier où se trouve l'erreur. Cliquez sur **Afficher les détails** pour consulter l'entrée de Log des événements correspondante pour les détails complets. Cliquez sur **Afficher les Logs** pour consulter le Log des événements complet. Cliquez sur Diagnostiquer l'erreur pour déboguer le problème avec Des indicateurs d'erreur accolés au code sont affichés pour les erreurs associées à une partie spécifique du code. Pour obtenir plus de détails, cliquez sur l'icône d' erreur ou survolez la ligne rouge. Une fenêtre contextuelle avec plus d'informations s'affiche. Vous pouvez ensuite cliquer sur Correction rapide pour afficher un ensemble d'actions visant à résoudre l'erreur. |
Journal des événements | Tous les événements Trigger lors de la dernière exécution du pipeline. Cliquez sur Afficher les logs ou sur n'importe quelle entrée dans le panneau des problèmes. |
Configuration du pipeline
Vous pouvez configurer votre pipeline à partir de l'éditeur de pipeline. Vous pouvez apporter des modifications aux paramètres du pipeline, à la planification ou aux autorisations.
Chacun d’eux est accessible depuis un bouton dans l’en-tête de l’éditeur, ou depuis des icônes dans le navigateur d’assets (la barre latérale gauche).
-
**Paramètres** (ou choisissez
dans le navigateur d’asset) :
Vous pouvez modifier les paramètres du pipeline à partir du panneau des paramètres, y compris les informations générales, le dossier racine et la configuration du code source, la configuration du compute, les notifications, les paramètres avancés, et plus encore.
-
Planifier (ou choisissez
dans le navigateur d'assets) :
Vous pouvez créer un ou plusieurs calendriers pour votre pipeline à partir de la boîte de dialogue de planification. Par exemple, si vous voulez l’exécuter quotidiennement, vous pouvez le définir ici. Il crée un job pour exécuter le pipeline selon la planification que vous choisissez. Vous pouvez ajouter ou supprimer un calendrier existant à partir de la boîte de dialogue de planification.
-
Partager (ou, depuis le menu
dans l'explorateur d'assets, choisissez
) :
Vous pouvez gérer les autorisations sur le pipeline pour les utilisateurs et les groupes à partir de la boîte de dialogue des autorisations du pipeline.
Event Logs
Vous pouvez publier le log des événements d'un pipeline dans Unity Catalog. Par default, le journal des événements de votre pipeline s'affiche dans l'interface utilisateur et est accessible pour interrogation par le propriétaire.
- Ouvrir les paramètres .
- Cliquez sur la flèche
en regard de Paramètres avancés .
- Cliquez sur Modifier les paramètres avancés .
- Sous **Logs d'événements**, cliquez sur **Publier dans le catalogue**.
- Fournissez un nom, un catalogue et un schéma pour les logs d'événements.
- Cliquez sur Enregistrer .
Vos événements de pipeline sont publiés dans la table que vous avez spécifiée.
Pour en savoir plus sur l’utilisation du journal des événements de pipeline, consultez Interroger le journal des événements.
Environnement du pipeline
Vous pouvez créer un environnement pour votre code source en ajoutant des dépendances dans **Paramètres**.
- Ouvrir les paramètres .
- Sous Environnement des pipelines , cliquez sur Modifier l’environnement .
- Cliquez sur Ajouter une dépendance pour ajouter une dépendance, comme si vous l'ajoutiez à un fichier
requirements.txt. Pour plus d'informations sur les dépendances, consultez Ajouter des dépendances au Notebook.
Databricks vous recommande d'pin la version avec ==. Consultez le package PyPI.
L'environnement s'applique à tous les fichiers de code source de votre pipeline.
Notifications
Vous pouvez ajouter des notifications à l'aide des **Paramètres du pipeline**.
- Ouvrir les paramètres .
- Dans la section **Notifications**, cliquez sur **Ajouter une notification**.
- Ajoutez une ou plusieurs adresses e-mail et les événements que vous souhaitez leur envoyer.
- Cliquez sur Ajouter une notification .
Créez des réponses personnalisées aux événements, y compris les notifications ou la gestion personnalisée, en utilisant les hooks d'événements Python.
monitoring des pipeline
Databricks fournit également des fonctionnalités pour surveiller les pipelines en cours d'exécution. L'éditeur affiche les résultats et les insights sur l'exécution la plus récente. Il est optimisé pour vous aider à itérer efficacement lorsque vous développez votre pipeline de manière interactive.
La page de monitoring du pipeline vous permet d’afficher les exécutions historiques, ce qui est utile lorsqu’un pipeline s’exécute selon un calendrier à l’aide d’un Job.
Il existe une expérience de surveillance default et une expérience de surveillance en préversion mise à jour. La section suivante décrit comment activer ou désactiver l'expérience de monitoring en préversion. Pour plus d'information concernant les deux expériences, consultez Surveiller les pipelines dans l'interface utilisateur.
L’expérience de monitoring est disponible via le bouton Jobs et pipelines situé sur le côté gauche de votre Workspace. Vous pouvez également accéder directement à la page de monitoring depuis l’éditeur en cliquant sur les résultats d’exécution dans le navigateur d’asset de pipeline.

Pour plus d'informations sur la page de monitoring, consultez Surveiller les pipelines dans l'interface utilisateur. L'interface utilisateur de monitoring comprend la possibilité de revenir à l'éditeur de Lakeflow Pipelines en sélectionnant Modifier le pipeline dans l'en-tête de l'interface utilisateur.
Genie Code pour le développement de pipelines
Aperçu public
Cette fonctionnalité est en aperçu public.
L'éditeur Lakeflow Pipelines s'intègre avec Genie Code, qui peut générer, modifier et déboguer des pipelines entiers directement à partir du langage naturel. Pour plus d'informations, consultez Utiliser Genie Code pour le développement de pipelines.
Limitations et problèmes connus
Consultez les limitations et problèmes connus suivants pour l'éditeur de pipeline ETL :
-
La barre latérale du navigateur du Workspace ne se concentre pas sur le pipeline si vous start par ouvrir un fichier dans le dossier
explorationsou un Notebook, car ces fichiers ou Notebooks ne font pas partie de la définition du code source du pipeline.Pour entrer en mode focus pipeline dans le navigateur Workspace, ouvrez un fichier associé au pipeline.
-
Les aperçus des données ne sont pas pris en charge pour les vues standard.
-
Les modules Python ne sont pas trouvés à partir d'une UDF, même s'ils se trouvent dans votre dossier racine ou sur votre
sys.path. Vous pouvez accéder à ces modules en ajoutant le chemin d'accès ausys.pathà partir de l'UDF, par exemple :sys.path.append(os.path.abspath(“/Workspace/Users/path/to/modules”)) -
%pip installn'est pas pris en charge à partir des fichiers (le type d'asset par default avec le nouvel éditeur). Vous pouvez ajouter des dépendances dans les paramètres. Consultez Environnement de pipeline.Alternativement, vous pouvez continuer à utiliser
%pip installdepuis un notebook associé à un pipeline, dans sa définition de code source.
FAQ
-
Pourquoi utiliser des fichiers et non des notebooks pour le code source ?
L'exécution par cellule des Notebook n'est pas compatible avec les pipeline. Les fonctionnalités standard des notebooks sont soit désactivées, soit modifiées lors de l’utilisation de pipelines, ce qui entraîne une confusion pour les utilisateurs habitués au comportement des notebooks.
Dans l'éditeur Lakeflow Pipelines, l'éditeur de fichiers est utilisé comme base pour un éditeur de premier ordre pour les pipelines. Les fonctionnalités sont explicitement ciblées sur les pipelines, comme Exécuter la table
, plutôt que de surcharger les fonctionnalités existantes avec un comportement différent.
-
Puis-je toujours utiliser les Notebook comme code source ?
Oui, vous le pouvez. Cependant, certaines fonctionnalités, telles que Exécuter la table
ou Exécuter le fichier , ne sont pas présentes.
Si vous avez un pipeline existant utilisant des notebooks, il fonctionne toujours dans le nouvel éditeur. Cependant, Databricks vous recommande de passer aux fichiers pour les nouveaux pipelines.
-
Comment puis-je ajouter du code existant à un pipeline nouvellement créé ?
Vous pouvez ajouter des fichiers de code source existants à un nouveau pipeline. Pour ajouter un dossier avec des fichiers existants, suivez ces étapes :
- Cliquez sur Paramètres .
- Sous **Code source**, cliquez sur **Configurer les chemins**.
- Cliquez sur **Ajouter un chemin** et choisissez le dossier pour les fichiers existants.
- Cliquez sur Enregistrer .
Vous pouvez également ajouter des fichiers individuels :
- Cliquez sur Tous les fichiers dans le navigateur d’assets de pipeline.
- Accédez à votre fichier, cliquez sur
, et cliquez sur Inclure dans le pipeline .
Envisagez de déplacer ces fichiers vers le dossier racine du pipeline. S’ils sont laissés en dehors du dossier racine du pipeline, ils sont affichés dans la section Fichiers externes .
-
Puis-je gérer le code source du pipeline dans Git ?
Vous pouvez gérer la source de votre pipeline dans Git en choisissant un dossier Git lorsque vous créez initialement le pipeline.
La gestion de votre source dans un dossier Git ajoute un contrôle de version pour votre code source. Cependant, pour le contrôle de version de votre configuration, Databricks recommande d'utiliser des Bundles d'automatisation déclaratifs pour définir la configuration du pipeline dans des fichiers de configuration de bundle qui peuvent être stockés dans Git (ou un autre système de contrôle de version). Pour plus d'informations, consultez What are Declarative Automation Bundles?.
Si vous n'avez pas créé le pipeline dans un dossier Git initialement, vous pouvez déplacer votre source vers un dossier Git. Databricks recommande d'utiliser l'action de l'éditeur pour déplacer tout le dossier racine vers un dossier Git. Cela met à jour tous les paramètres en conséquence. Voir le dossier racine.
Pour déplacer le dossier racine vers un dossier Git dans le navigateur d'assets du pipeline :
- Cliquez sur
pour le dossier racine.
- Cliquez sur Déplacer le dossier racine .
- Choisissez un nouvel emplacement pour votre dossier racine et cliquez sur Déplacer .
Consultez la section Dossier racine pour plus d'informations.
Après le déplacement, vous voyez l'icône Git familière à côté du nom de votre dossier racine.
Pour déplacer le dossier racine du pipeline, utilisez le navigateur d'asset de pipeline et les étapes ci-dessus. Tout autre déplacement rompt les configurations du pipeline, et vous devez configurer manuellement le chemin de dossier correct dans les Paramètres .
-
Puis-je avoir plusieurs pipelines dans le même dossier racine ?
Vous pouvez, mais Databricks recommande de n'avoir qu'un seul pipeline par dossier racine.
-
Quand devrais-je exécuter une simulation ?
Cliquez sur Simulation pour vérifier votre code sans mettre à jour les tables.
-
Quand dois-je utiliser des vues temporaires, et quand dois-je utiliser des vues matérialisées dans mon code ?
Utilisez les vues temporaires lorsque vous ne voulez pas matérialiser les données. Par exemple, il s'agit d'une étape dans une séquence d'étapes pour préparer les données avant qu'elles ne soient prêtes à être matérialisées à l'aide d'une table de streaming ou d'une vue matérialisée enregistrée dans le Catalogue.