Créez une préparation des données visuelles dans Lakeflow Designer
Lakeflow Designer vous permet de créer des workflows de transformation de données sur un canevas visuel par « glisser-déposer ». Cette page explique comment créer une préparation de données visuelle — de l'ajout d'une source de données et l'enchaînement des opérateurs à la prévisualisation des résultats et l'écriture dans Unity Catalog.
Exigences
Pour utiliser Lakeflow Designer, vous devez disposer de :
- Un workspace Databricks avec Unity Catalog activé.
CAN USEautorisation sur au moins une ressource de compute à usage général (serverless ou à usage général).
Sélectionnez le compute à utiliser dans le sélecteur de compute en haut à droite du Designer, à côté du bouton **Planifier**.
Créer une nouvelle préparation de données visuelles
Pour créer une nouvelle préparation de données visuelles, cliquez sur Nouveau dans la barre latérale et sélectionnez Préparation de données visuelles .
Le concepteur s'ouvre sur un écran d'accueil où vous pouvez ajouter une source de données ou explorer un exemple de préparation visuelle des données.
Pour trouver vos fichiers de préparation visuelle de données existants, ouvrez la page Préparation visuelle des données depuis la barre latérale. Cette page répertorie tous vos fichiers de préparation visuelle de données et inclut une vidéo de start pour vous aider à start à utiliser Lakeflow Designer.
Ajouter une source de données
Chaque préparation visuelle des données start avec une ou plusieurs sources de données. L'opérateur Source représente une source de données sur la zone de travail.
Pour ajouter une source de données :
-
Ajouter un opérateur Source. Depuis l'écran d'accueil, cliquez sur **Sélectionner l'opérateur source**. Depuis le canevas, ouvrez le menu de l'opérateur et sélectionnez Source .
-
Dans le volet de configuration Source , choisissez comment importer vos données :
- Sélectionner une table existante.
- upload un fichier CSV ou Excel local.
- Créer une table à partir d'un fichier.
- Importer depuis Google Drive ou SharePoint.
-
Sélectionnez ou configurez votre source de données. L'opérateur Source apparaît sur la toile.
Vous pouvez également faire glisser et déposer un fichier CSV ou Excel directement sur le canevas pour créer rapidement un opérateur Source.
Pour modifier la source ultérieurement, ouvrez l'opérateur Source et cliquez sur Sélectionner une nouvelle source de données . La modification de la source invalide le cache de sortie pour tous les opérateurs en aval.
Pour obtenir tous les détails sur chaque option d'ingestion, consultez Ingérer des données dans Lakeflow Designer.
Ajouter et configurer les opérateurs
Pour ajouter un opérateur, ouvrez le menu de l’opérateur dans le volet latéral gauche du canevas. Cliquez sur un opérateur pour l'ajouter au canevas, ou faites glisser un opérateur du menu sur le canevas. Vous pouvez également cliquer sur le bouton **+** à côté de tout opérateur existant pour ajouter un nouvel opérateur avec une connexion automatique.

Pour configurer un opérateur, double-cliquez dessus, ou passez le curseur dessus et cliquez sur ( Modifier l'opérateur ), pour ouvrir le volet de configuration. Définissez les options pour ce type d'opérateur, puis cliquez sur Appliquer .
Pour plus de détails sur chaque opérateur disponible, consultez Opérateurs intégrés dans Lakeflow Designer. Pour plus de détails sur la création de vos propres opérateurs définis par l'utilisateur, consultez Opérateurs définis par l'utilisateur dans Lakeflow Designer.
Connecter les opérateurs
Pour connecter deux opérateurs, cliquez et faites glisser la poignée de sortie (le petit cercle sur le bord droit d'un opérateur) vers la poignée d'entrée (le petit cercle sur le bord gauche de l'opérateur suivant). Ceci spécifie que les données circulent du premier opérateur vers le second. Les données circulent de gauche à droite à travers la préparation des données visuelles.

Certains opérateurs, tels que Join et Combine , acceptent plusieurs entrées.
Pour supprimer une connexion, survolez-la et cliquez sur dans la barre d'outils qui apparaît sur la connexion.
Utiliser Genie Code
À tout moment lors de la modification dans Lakeflow Designer, vous pouvez créer des invites pour que Genie Code vous aide. See Genie Code.

Lors de l'utilisation de Genie Code, les boutons suivants offrent des fonctionnalités supplémentaires :
: Joindre un fichier à utiliser dans le cadre de l'invite.
: Utilisez pour mentionner des objets, tels que des tables ou des fichiers, à utiliser dans le cadre du prompt.
: démarre un nouveau fil de discussion avec un nouveau contexte d'agent.
: Ouvre le volet latéral pour l'historique des conversations et une vue plus détaillée de ce que fait l'agent.
Genie Code affiche un résumé d'une ligne de sa modification la plus récente au-dessus de la zone de saisie.
Aperçu des résultats
Sélectionnez n'importe quel opérateur pour afficher les résultats dans le volet de sortie en bas de l'écran. Pour la plupart des types d'opérateurs, les données d'entrée se trouvent à gauche et les données de sortie à droite. Les opérateurs qui produisent des résultats non tabulaires, tels que des graphiques, HTML ou des images, affichent ces sorties directement dans le volet de sortie.
Utilisez le contrôle d'affichage dans le volet de sortie pour basculer entre l'entrée et la sortie (default), l'entrée uniquement ou la sortie uniquement. Dans la vue combinée, faites glisser le séparateur pour redimensionner les volets d'entrée et de sortie.
Si l’exécution de l’opérateur sélectionné contient des données de performance, cliquez sur Performance dans le volet de sortie pour ouvrir le profil de requête complet.

By default, les opérateurs traitent un échantillon limité de données pour les aperçus. Utilisez le menu Preview dans la barre d’outils pour définir le nombre par default de lignes d’entrée à traiter pour les aperçus. Sélectionnez First N rows et saisissez une limite de lignes, ou sélectionnez All rows .
Le menu Rows scanned dans le volet de sortie peut être utilisé pour remplacer le nombre de lignes d'aperçu d'un opérateur individuel.
- Lignes analysées : hérité : utilise le paramètre default du menu Aperçu .
- Lignes analysées : limite : traite les N premières lignes en entrée. Saisissez la limite de lignes dans le champ situé à côté du menu.
- Lignes analysées : toutes les lignes : traite toutes les lignes en entrée.
Lorsque vous générez un aperçu pour l’ensemble des lignes, Designer affiche le nombre exact de lignes en sortie sous l’opérateur sur le canevas. Pour un opérateur doté de plusieurs sorties, passez le curseur sur le badge du nombre de lignes pour afficher le décompte de chaque sortie.
La génération d’un aperçu avec Lignes analysées : toutes les lignes réexécute l’opérateur et ses opérateurs en amont avec le dataset complet et illimité, ce qui peut prendre beaucoup de temps.
Le paramètre Lignes analysées contrôle uniquement le traitement de l’aperçu. Les exécutions planifiées et les exécutions de job traitent l’ensemble du dataset.
Exécuter la préparation complète des données visuelles
Cliquez sur Tout exécuter pour exécuter chaque opérateur sur la toile par rapport au dataset complet en une seule action, sans prévisualiser chaque opérateur individuellement. Designer exécute l’intégralité du fichier de préparation de données visuelles et met à jour les résultats pour chaque opérateur, puis affiche le nombre exact de lignes en sortie de chaque opérateur sous celui-ci sur la toile.
Transformez les données directement dans la table de résultats
En plus d'ajouter des opérateurs pour transformer vos données, vous pouvez préparer vos données en agissant directement sur elles dans la table de résultats. Les modifications en prévisualisation changent uniquement l'échantillon de prévisualisation et sont collectées en tant que Modifications en attente ; elles ne modifient pas vos données ou votre flux de travail tant que vous ne les appliquez pas.

Les actions suivantes sont prises en charge dans l’aperçu des données :
- Insérer une colonne : sélectionnez Insérer une colonne , puis saisissez un nom et une expression.
- Changer le type d'une colonne : sélectionnez Changer le type et choisissez le type cible.
- Supprimer les lignes nulles : sélectionnez Supprimer les valeurs nulles pour supprimer les lignes où la colonne est nulle.
- Filtrer les lignes : ajoutez une ou plusieurs conditions de filtrage sur la colonne.
- Renommer une colonne : double-cliquez sur l’en-tête de colonne et saisissez un nouveau nom.
- Masquer, réorganiser ou supprimer des colonnes : masquez ou supprimez une colonne, ou faites glisser les en-têtes de colonne pour les réorganiser.
- Trier les lignes : ajoutez une direction de tri sur la colonne. Le tri sur plusieurs colonnes s'ajoute à l'ordre de tri.
- Supprimer les lignes en double : sélectionnez Supprimer les doublons , puis choisissez les colonnes à comparer.
Vérifier et appliquer les modifications en attente
Les modifications mises en attente sont collectées dans le volet Modifications en attente . Ouvrez-le pour revoir ou supprimer une modification avant de l’appliquer. Pour modifier une nouvelle colonne mise en attente, double-cliquez dessus dans l’aperçu et mettez à jour son nom ou son expression.
Pour ajouter les modifications en attente à votre flux de travail, sélectionnez Appliquer à la toile . Lakeflow Designer ajoute un opérateur pour chaque type de modification, dans l'ordre où vous les avez mises en attente. Chaque type de modification correspond à un opérateur :
Si vous basculez l'aperçu pour traiter l'intégralité du dataset alors que vous avez des modifications en attente, Lakeflow Designer vous invite à les appliquer d'abord afin que vos modifications temporaires ne soient pas perdues.
download les résultats
Utilisez le contrôle download dans le volet de sortie pour exporter les résultats de l'aperçu vers un fichier :
- Lignes affichées : download les lignes actuellement présentées dans l'aperçu, au format CSV ou Excel.
- Toutes les lignes : download le dataset complet. Disponible lorsque vous avez l’autorisation d’exécuter le workflow. L’exportation Excel de toutes les lignes nécessite un compute Serverless.
Votre administrateur de Workspace peut désactiver le download.
Écrire les résultats
Ajoutez un opérateur Output pour écrire vos résultats. L'opérateur de sortie peut écrire dans une table Unity Catalog, publier les résultats en tant que vue matérialisée, ou écrire un fichier CSV, Excel ou JSON dans un volume Unity Catalog.
- Ouvrez le menu de l'opérateur et sélectionnez Sortie , ou cliquez sur + à côté de votre dernier opérateur et sélectionnez Sortie .
- Connectez le handle de sortie de votre dernière transformation au handle d'entrée de l'opérateur Output si ce n'est pas déjà connecté.
- Double-cliquez sur l'opérateur Output pour ouvrir son volet de configuration.
- Sélectionnez un type de sortie et configurez la destination. Pour une table, entrez un nom de table , sélectionnez l' emplacement de sortie (catalogue et schéma), et sélectionnez un mode d'écriture .
- Cliquez sur Exécuter .
Pour l'ensemble complet des types de sortie et des modes d'écriture, consultez Sortie.
Planifier ou exécuter en production
Vous pouvez automatiser vos workflows en les planifiant en tant que jobs. Cliquez sur le bouton Planifier dans le menu supérieur pour créer un job planifié pour votre préparation visuelle des données, ou ajoutez la préparation visuelle des données à un job Databricks plus grand en tant que tâche.
Pour transférer une préparation de données visuelles en production, notamment en l'enregistrant dans Git, en la déployant avec des bundles d'automatisation déclaratifs et en la paramétrant entre les environnements, consultez Transférer un fichier de préparation de données visuelles en production.

Exporter et importer un fichier de préparation des données visuelles
Les fichiers de préparation visuelle des données sont stockés en mode natif dans le workspace. Vous pouvez les exporter et les importer pour les déplacer entre les workspaces ou les partager.
Pour exporter un fichier de préparation de données visuelles :
- Cliquez sur
dans le coin supérieur droit.
- Sélectionnez Fichier > Exporter .
- Le fichier est exporté en tant que
<file_name>.designer.ipynb.
Pour importer depuis la page Visual data prep :
- Cliquez sur la flèche du menu déroulant située à côté de New , puis sélectionnez Import file .
- Pour importer un fichier
.designer.ipynb, sélectionnez As visual data prep , puis sélectionnez le fichier. Le Designer ouvre la préparation de données visuelles importée dans l’éditeur. - Pour créer une préparation de données visuelles avec des opérateurs Source pour les fichiers upload, sélectionnez As source , puis upload un ou plusieurs fichiers CSV, JSON, Excel ou PDF.
Pour importer à partir du système de fichiers du workspace :
- Dans le système de fichiers du workspace, cliquez sur
.
- Sélectionnez Importer .
- Sélectionnez le fichier de préparation visuelle des données à importer.
Pour versionner un fichier de préparation de données visuelles avec Git et le mettre en production, consultez Mettre un fichier de préparation de données visuelles en production.
Renommer un fichier de préparation de données visuelles
Pour renommer un fichier de préparation de données visuelles, cliquez sur le tab affichant son nom en haut de l'éditeur, puis saisissez un nouveau nom.
Supprimer un fichier de préparation des données visuelles
Pour supprimer un fichier de préparation de données visuelles, ouvrez le menu du fichier et sélectionnez Déplacer vers la corbeille .
Pour supprimer plusieurs fichiers de préparation de données visuelles à la fois, ouvrez Workspace depuis la navigation de gauche, sélectionnez les fichiers que vous souhaitez supprimer, et sélectionnez Déplacer vers la corbeille en haut de la liste.
Conseils supplémentaires lorsque vous travaillez sur la toile.
Les actions suivantes sont disponibles sur la toile pour vous aider à modifier votre préparation visuelle des données.
- Renommer un opérateur : cliquez sur la boîte en haut de n'importe quel volet de configuration pour renommer l'opérateur. Des noms descriptifs rendent votre préparation visuelle des données plus facile à comprendre en un coup d'œil. Certains opérateurs, comme l'opérateur SQL, peuvent faire référence à la sortie d'autres opérateurs par leur nom.
- Copier un opérateur : survolez un opérateur et cliquez sur
, ou sélectionnez un opérateur et appuyez sur Cmd/Ctrl+C puis sur Cmd/Ctrl+V .
- Supprimer un opérateur : Passez le curseur sur un opérateur et cliquez sur
dans la barre d’outils qui apparaît au-dessus, ou sélectionnez l’opérateur et appuyez sur Suppr .
- Activer ou désactiver un opérateur : faites un clic droit sur un opérateur ou un groupe, puis sélectionnez Désactiver pour l'exclure des exécutions, ou Activer pour l'inclure à nouveau. Un opérateur désactivé ne produit aucune ligne de sortie ; les opérateurs en aval reçoivent donc un résultat vide jusqu'à ce que vous l'activiez.
- Auto-layout : Cliquez sur l'icône
dans la barre d'outils d'en-tête pour organiser automatiquement tous les opérateurs dans un compact Layout.
- Ajuster la vue : cliquez sur
dans la barre d'outils d'en-tête pour voir tous les opérateurs dans la fenêtre d'affichage actuelle.
- Annuler et rétablir : appuyez sur Cmd/Ctrl+Z et Cmd/Ctrl+Maj+Z , ou utilisez les boutons Annuler et Rétablir dans la barre d'outils d'en-tête.
- Ouvrez la palette de commandes : Appuyez sur Cmd+Shift+P sur macOS ou Ctrl+Shift+P sur Windows pour accéder rapidement aux actions de l'éditeur.
- Afficher le code généré : sélectionnez Table des matières dans le volet gauche, sélectionnez un opérateur, puis développez la section Code généré pour voir le code généré par le Concepteur. Pour en savoir plus, consultez la table des matières.
- Afficher l’historique des versions : cliquez sur
dans le volet de droite pour ouvrir l’historique des versions de la préparation de données visuelles, qui répertorie ses modifications. Sélectionnez une version pour voir une comparaison visuelle sur la toile qui la compare avec la version suivante, avec les opérateurs ajoutés, supprimés et modifiés mis en évidence. Le survol d’un opérateur dans la table des matières met en évidence l’opérateur correspondant dans les deux versions de la comparaison.