Qu’est-ce que Lakeflow Designer ?
Lakeflow Designer offre un canevas visuel permettant aux analystes de réaliser l'analytique, la préparation et l'automatisation de base. Dans Designer, vous créez des fichiers de préparation de données visuelles, chacun étant composé d'une séquence d'opérateurs (tels que filtre, jointure et transformation) organisés en DAG pour produire un résultat. Toutes les transformations sont basées sur du code, ce qui vous permet de gérer les versions des fichiers dans Git et de les planifier en tant que Jobs pour passer en production de manière transparente.
Avec Lakeflow Designer, vous pouvez :
- Concevez des workflows à l'aide d'un canevas glisser-déposer.
- Transformez les données sans écrire de code à l’aide d’opérateurs intégrés pour filtrer, agréger, joindre et remodeler les données.
- Utilisez Genie Code pour générer ou affiner les transformations dans votre préparation visuelle des données en utilisant le langage naturel.
- Prévisualisez chaque étape intermédiaire sans exécuter tout le pipeline.

Dans l'image ci-dessus, vous pouvez voir :
- Le menu, avec les onglets Opérateurs et Paramètres
- Un opérateur
- Une connexion entre deux opérateurs
- L'espace de dessin en glisser-déposer
- L'invite Genie Code
- Le volet de sortie
- Le profilage des données de la sortie
Concepts clés
Le menu
Le menu dans le volet de gauche est l'endroit où vous trouverez les blocs de construction pour votre préparation visuelle des données. Il comporte deux tab :
- Opérateurs : Parcourez et recherchez les opérateurs intégrés. Faites glisser et déposez les types d'opérateurs de la liste sur le canvas pour les ajouter.
- Parameters : définissez et gérez les parameters pour la préparation visuelle des données.
La toile
Le canevas est le main Workspace où vous ajoutez, configurez et connectez des opérateurs pour construire votre préparation visuelle des données.
Pour naviguer dans la toile :
- Panoramique : maintenez la touche Espace enfoncée tout en cliquant et en faisant glisser, ou glissez deux doigts sur un pavé tactile.
- Zoom : Pincez ou étirez sur un pavé tactile, ou maintenez la touche Ctrl enfoncée et faites défiler.
La barre d’outils du canevas est située dans l’en-tête avec les outils de navigation du canevas : zoom avant,
zoom arrière,
ajuster la vue,
auto-layout, et
mode glisser-déposer.
Cliquez avec le bouton droit n'importe où sur la toile pour accéder aux actions courantes, notamment l'ajout d'opérateurs, l'annulation et le rétablissement, l'auto-Layout, l'ajustement de la vue et l'ouverture du panneau de code.
Vous pouvez également glisser-déposer un fichier Excel ou CSV directement sur le canevas pour créer un opérateur Source pour ce fichier.
Opérateurs
Les opérateurs sont les blocs de construction d'une préparation visuelle des données. Un opérateur est une action telle qu'une jointure, une transformation ou un filtre. Vous enchaînez les opérateurs sur le canevas pour créer un workflow. Chaque opérateur est configurable en fonction de son type. Les opérateurs affichent une description générée par l'IA de leur effet ; la modification de la description reconfigure l'opérateur.

Lakeflow Designer inclut des opérateurs intégrés pour les tâches courantes de transformations de données. Pour plus de détails, consultez Opérateurs intégrés dans Lakeflow Designer.
Connexions
Les connexions définissent comment les données circulent entre les opérateurs. Pour créer une connexion, faites glisser le petit cercle situé sur le bord droit d'un opérateur vers le petit cercle situé sur le bord gauche d'un autre opérateur. Ceci spécifie que les données s'écoulent du premier opérateur vers le second. Les données circulent de gauche à droite à travers la préparation visuelle des données. Certains opérateurs, tels que **Join** et **Combine**, acceptent plusieurs connexions d'entrée.

Le volet de sortie
Le volet de sortie apparaît en bas de l'écran lorsque vous sélectionnez un opérateur. Sélectionnez un opérateur pour voir les résultats dans la fenêtre de sortie en bas de l'écran. Pour la plupart des types d'opérateurs, les données d'entrée se trouvent à gauche et les données de sortie se trouvent à droite. Les opérateurs qui produisent des résultats non tabulaires, tels que des graphiques, du HTML ou des images, affichent ces sorties directement dans le volet de sortie.
Utilisez le contrôle d'affichage dans le volet de sortie pour basculer entre l'entrée et la sortie (default), l'entrée uniquement ou la sortie uniquement. Dans la vue combinée, faites glisser le séparateur pour redimensionner les volets d'entrée et de sortie.
By default, les opérateurs traitent un échantillon limité de données. Utilisez le menu déroulant Lignes analysées dans le volet de sortie pour contrôler le nombre de lignes à traiter :
- Lignes analysées : Limite : Traite les N premières lignes d’entrée. Spécifiez le nombre de lignes dans le champ à côté de la liste déroulante.
- **Lignes analysées : maximum** : Traite toutes les lignes d'entrée.

L'exécution avec Lignes analysées : Max relance tous les opérateurs en amont avec le dataset complet et non borné, et peut prendre beaucoup de temps.
Le profilage des données
Dans le volet de sortie, vous pouvez choisir d'afficher les détails des données dans votre sortie. Dans le coin supérieur droit du volet de sortie, choisissez le bouton latéral pour ouvrir les détails de la sélection. Sélectionnez un sous-ensemble de vos données pour afficher les détails de votre sélection.

Genie Code
Genie Code vous permet de décrire les Transformations en langage naturel. Toutes les interactions sont agentiques et utilisent le contexte de la plateforme Databricks. See Genie Code.

Saisissez une invite pour générer ou modifier les Transformations. Pour consulter l'historique des interactions avec Genie Code et obtenir plus de détails sur chaque réponse, ouvrez le volet latéral Genie Code en cliquant sur dans la barre latérale droite. Lorsque le volet latéral est ouvert, la barre d'outils du canevas est réduite. Genie Code affiche un résumé d'une ligne de sa modification la plus récente au-dessus de la zone de saisie.
parameter
Les *parameters* sont des valeurs nommées définies pour l'ensemble de la préparation visuelle des données que vous pouvez référencer à partir des opérateurs SQL et Python. Pour gérer les parameters, ouvrez l'onglet **tab** dans le volet de gauche, à côté de l'onglet **tab**.
Chaque paramètre a une valeur que vous définissez lorsque vous le créez. Lorsque vous planifiez l'exécution de la préparation des données visuelles, vous pouvez éventuellement remplacer ces valeurs pour chaque planification. Par exemple, vous pourriez planifier l'exécution de la même préparation des données visuelles tous les jours à midi avec un paramètre environment défini sur test, et de nouveau à 14 h avec environment défini sur production.
Référencez un paramètre d'un opérateur comme suit :
- Opérateur SQL : utilisez la syntaxe des marqueurs de paramètres nommés, comme
:environment. Voir Utiliser les marqueurs de paramètres nommés. - Python operator : appelez
dbutils.widgets.get(), tel quedbutils.widgets.get("environment"). Voir l'utilitaire Widgets (dbutils.widgets).
Lorsque vous ouvrez un opérateur SQL ou Python pour modification, Lakeflow Designer affiche un exemple de la manière de référencer les paramètres disponibles au-dessus de l'éditeur source.