Créez une préparation des données visuelles dans Lakeflow Designer
Lakeflow Designer vous permet de créer des workflows de transformation de données sur un canevas visuel par « glisser-déposer ». Cette page explique comment créer une préparation de données visuelle — de l'ajout d'une source de données et l'enchaînement des opérateurs à la prévisualisation des résultats et l'écriture dans Unity Catalog.
Exigences
Pour utiliser Lakeflow Designer, vous devez disposer de :
- Un workspace Databricks avec Unity Catalog activé.
CAN USEautorisation sur au moins une ressource de compute à usage général (serverless ou à usage général).
Sélectionnez le compute à utiliser dans le sélecteur de compute en haut à droite du Designer, à côté du bouton **Planifier**.
Créer une nouvelle préparation de données visuelles
Pour créer une nouvelle préparation de données visuelles, cliquez sur Nouveau dans la barre latérale et sélectionnez Préparation de données visuelles .
Le concepteur s'ouvre sur un écran d'accueil où vous pouvez ajouter une source de données ou explorer un exemple de préparation visuelle des données.
Ajouter une source de données
Chaque préparation visuelle des données start avec une ou plusieurs sources de données. L'opérateur Source représente une source de données sur la zone de travail.
Pour ajouter une source de données :
- Ajouter un opérateur Source. Depuis l'écran d'accueil, cliquez sur **Sélectionner l'opérateur source**. Depuis le canevas, ouvrez le menu de l'opérateur et sélectionnez Source .
- Dans le volet de configuration de la source, choisissez comment importer vos données. Vous pouvez parcourir une table existante, upload un fichier CSV ou Excel local, créer une table à partir d'un fichier, ou importer depuis Google Drive ou SharePoint.
- Sélectionnez ou configurez votre source de données. L'opérateur Source apparaît sur la toile.
Vous pouvez également faire glisser et déposer un fichier CSV ou Excel directement sur le canevas pour créer rapidement un opérateur Source.
Pour modifier la source ultérieurement, ouvrez l'opérateur Source et cliquez sur Sélectionner une nouvelle source de données . La modification de la source invalide le cache de sortie pour tous les opérateurs en aval.
Pour obtenir tous les détails sur chaque option d'ingestion, consultez Ingérer des données dans Lakeflow Designer.
Ajouter et configurer les opérateurs
Pour ajouter un opérateur, ouvrez le menu de l’opérateur dans le volet latéral gauche du canevas. Cliquez sur un opérateur pour l'ajouter au canevas, ou faites glisser un opérateur du menu sur le canevas. Vous pouvez également cliquer sur le bouton **+** à côté de tout opérateur existant pour ajouter un nouvel opérateur avec une connexion automatique.

Pour configurer un opérateur, double-cliquez dessus, ou maintenez le pointeur dessus et cliquez sur ( Modifier l’opérateur ) pour ouvrir le panneau de configuration. Définissez les options pour ce type d’opérateur, puis cliquez sur **Appliquer**.
Pour plus de détails sur chaque opérateur disponible, consultez Opérateurs intégrés dans Lakeflow Designer. Pour plus de détails sur la création de vos propres opérateurs définis par l'utilisateur, consultez Opérateurs définis par l'utilisateur dans Lakeflow Designer.
Connecter les opérateurs
Pour connecter deux opérateurs, cliquez et faites glisser la poignée de sortie (le petit cercle sur le bord droit d'un opérateur) vers la poignée d'entrée (le petit cercle sur le bord gauche de l'opérateur suivant). Ceci spécifie que les données circulent du premier opérateur vers le second. Les données circulent de gauche à droite à travers la préparation des données visuelles.

Certains opérateurs, tels que Join et Combine , acceptent plusieurs entrées.
Pour supprimer une connexion, maintenez le curseur dessus et cliquez sur dans la barre d'outils qui apparaît au-dessus de la connexion.
Utiliser Genie Code
À tout moment lors de la modification dans Lakeflow Designer, vous pouvez créer des invites pour que Genie Code vous aide. See Genie Code.

Lors de l'utilisation de Genie Code, les boutons suivants offrent des fonctionnalités supplémentaires :
: Upload d'une image à utiliser comme élément de l'invite.
: Utilisez pour mentionner des objets, tels que des tables ou des fichiers, à utiliser dans le cadre du prompt.
: démarre un nouveau fil de discussion avec un nouveau contexte d'agent.
: Ouvre le volet latéral pour l'historique des conversations et une vue plus détaillée de ce que fait l'agent.
Genie Code affiche un résumé d'une ligne de sa modification la plus récente au-dessus de la zone de saisie.
Aperçu des résultats
Sélectionnez n'importe quel opérateur pour afficher les résultats dans le volet de sortie en bas de l'écran. Pour la plupart des types d'opérateurs, les données d'entrée se trouvent à gauche et les données de sortie à droite. Les opérateurs qui produisent des résultats non tabulaires, tels que des graphiques, HTML ou des images, affichent ces sorties directement dans le volet de sortie.
Utilisez le contrôle d'affichage dans le volet de sortie pour basculer entre l'entrée et la sortie (default), l'entrée uniquement ou la sortie uniquement. Dans la vue combinée, faites glisser le séparateur pour redimensionner les volets d'entrée et de sortie.

By default, les opérateurs traitent un échantillon limité de données, pour les aperçus. Utilisez le menu déroulant Lignes analysées dans le volet de sortie pour contrôler le nombre de lignes à traiter :
- Lignes analysées : Limite : Traite les N premières lignes d’entrée. Spécifiez le nombre de lignes dans le champ à côté de la liste déroulante.
- **Lignes analysées : maximum** : Traite toutes les lignes d'entrée.
L'exécution avec Lignes analysées : Max relance tous les opérateurs en amont avec le dataset complet et non borné, et peut prendre beaucoup de temps.
Le paramètre Lignes analysées contrôle uniquement le traitement de l'aperçu. Les exécutions planifiées et les exécutions de job traitent toujours le dataset complet.
Écrire les résultats dans Unity Catalog
Ajoutez un opérateur **Output** pour écrire vos résultats dans une table dans Unity Catalog :
- Ouvrez le menu de l'opérateur et sélectionnez Sortie , ou cliquez sur + à côté de votre dernier opérateur et sélectionnez Sortie .
- Connectez le handle de sortie de votre dernière transformation au handle d'entrée de l'opérateur Output si ce n'est pas déjà connecté.
- Double-cliquez sur l'opérateur Output pour ouvrir son volet de configuration.
- Saisissez un nom de table et sélectionnez l' emplacement de sortie (catalogue et schéma).
- Cliquez sur Exécuter .
Chaque exécution crée ou remplace la table de sortie gérée, donc les exécutions planifiées la remplacent plutôt que de l'ajouter. Voir Output.
Planifier ou exécuter en production
Vous pouvez automatiser vos workflows en les planifiant comme des jobs.
- Planifier directement : cliquez sur le bouton Planifier dans le menu supérieur pour créer un job planifié pour votre préparation visuelle des données.
- Ajouter à un job : Créez un job Databricks et choisissez votre préparation de données visuelle comme tâche. Ceci vous permet de combiner cette préparation visuelle des données avec d'autres tâches dans un pipeline plus grand.
Pour afficher et gérer les planifications existantes, cliquez à nouveau sur Planning pour ouvrir la liste. Cliquez sur Ajouter un planning pour en créer un autre, ou ouvrez le menu kebab d'un planning pour le Modifier , l' Exécuter maintenant , le Mettre en pause , le Cloner , l' Afficher dans les jobs ou le Supprimer .
Lorsque vous planifiez une préparation visuelle des données, vous pouvez éventuellement remplacer les valeurs de ses paramètres pour cette planification. Par exemple, vous pouvez créer une planification qui s'exécute avec un paramètre environment défini sur test et une autre qui s'exécute avec ce même paramètre défini sur production. See parameter.

Stocker et gérer les fichiers de préparation de données visuelles
Les fichiers de préparation des données visuelles sont stockés en mode natif dans le Workspace. Vous pouvez les exporter, les importer et les suivre avec Git lorsqu'ils sont placés dans un dossier Git.
Exporter un fichier de préparation des données visuelles
- Cliquez sur
dans le coin supérieur droit.
- Sélectionnez Fichier > Exporter .
- Le fichier est exporté en tant que
<file_name>.designer.ipynb.
Importer un fichier de préparation des données visuelles
- Dans le système de fichiers du workspace, cliquez sur
.
- Sélectionnez Importer .
- Choisissez le fichier de préparation de données visuelles à importer.
Utiliser les fichiers de préparation de données visuelles avec Git
- Créer un dossier Git dans votre workspace.
- Déplacez le fichier de préparation des données visuelles dans ce dossier Git.
- Suivez, commit et versionnez le fichier comme n'importe quel autre Notebook dans Git.
- Dans Git, le fichier apparaît comme
<file_name>.designer.ipynb.
Renommer une préparation des données visuelles
Pour renommer une préparation de données visuelles, cliquez sur la tab affichant son nom en haut de l'éditeur, puis saisissez un nouveau nom.
Supprimer une préparation des données visuelles
Pour supprimer une préparation de données visuelles, ouvrez le menu kebab pour le fichier et sélectionnez Déplacer vers la corbeille .
Pour supprimer plusieurs fichiers de préparation de données visuelles en une seule fois, ouvrez Workspace depuis le panneau de navigation de gauche, sélectionnez les fichiers que vous souhaitez supprimer et choisissez Déplacer vers la corbeille en haut de la liste.
Conseils supplémentaires lorsque vous travaillez sur la toile.
Les actions suivantes sont disponibles sur la toile pour vous aider à modifier votre préparation visuelle des données.
- Renommer un opérateur : Cliquez sur le champ de texte en haut de n'importe quel volet de configuration pour renommer l'opérateur. Les noms descriptifs facilitent la compréhension de votre préparation visuelle des données en un coup d'œil. Certains opérateurs, tels que l'opérateur SQL, peuvent faire référence à la sortie d'autres opérateurs par leur nom.
- Copier un opérateur : Passez le pointeur sur un opérateur et cliquez sur
, ou sélectionnez un opérateur et appuyez sur Cmd/Ctrl+C puis sur Cmd/Ctrl+V .
- Supprimer un opérateur : Maintenez le pointeur sur un opérateur et cliquez sur
dans la barre d’outils qui apparaît au-dessus, ou sélectionnez l’opérateur et appuyez sur Supprimer .
- Auto-layout : Cliquez sur l'icône
dans la barre d'outils d'en-tête pour organiser automatiquement tous les opérateurs dans un compact Layout.
- Ajuster la vue : cliquez sur
dans la barre d'outils d'en-tête pour voir tous les opérateurs dans la fenêtre d'affichage actuelle.
- Annuler et rétablir : appuyez sur Cmd/Ctrl+Z et Cmd/Ctrl+Maj+Z , ou utilisez les boutons Annuler et Rétablir dans la barre d'outils d'en-tête.
- Afficher le code généré : pour voir le code PySpark généré par Designer, ouvrez l' historique des versions dans le volet droit, poussez le fichier dans un dossier Git et affichez-le là, ou visualisez le code dans les détails d'exécution du Job.
- Afficher l'historique des versions : Cliquez sur
dans le volet droit pour ouvrir l'historique des versions de la préparation visuelle des données, qui répertorie ses modifications. Sélectionnez une version à comparer avec la version suivante.