Opérateurs intégrés dans Lakeflow Designer
Lakeflow Designer comprend des opérateurs intégrés pour les tâches courantes de préparation et de transformations de données. Ouvrez le menu de l'opérateur dans le panneau latéral gauche pour parcourir les opérateurs par catégorie, ou utilisez Rechercher un opérateur… en haut du panneau. La recherche d'opérateur suggère des opérateurs en fonction de votre intention. Par exemple, la saisie de average by month renvoie l'opérateur Agrégat . Pour configurer un opérateur après l'avoir ajouté au canevas, double-cliquez dessus, ou survolez-le et cliquez sur ( Modifier l'opérateur ), pour ouvrir le panneau de configuration.

Chaque opérateur affiche une description générée par l'IA de ce qu'il fait. La description agit également comme un éditeur pour l'opérateur : la modification de la description reconfigure l'opérateur afin qu'il corresponde à votre description.
Pour découvrir comment créer vos propres opérateurs définis par l’utilisateur, consultez Opérateurs définis par l’utilisateur dans Lakeflow Designer.
Source et sortie
Source
Importe les données dans Designer depuis une table Unity Catalog ou une autre source prise en charge. Pour sélectionner une source, recherchez une table ou un fichier par nom, ou naviguez par catalogue et schéma. Vous pouvez également créer une nouvelle table à partir de ce volet.
Après avoir sélectionné une table, le volet affiche le nom de la table, son propriétaire et l'heure de la dernière mise à jour. Cliquez sur Sélectionner une nouvelle source de données pour changer la source. La modification de la source invalide le cache de sortie pour tous les opérateurs en aval.
Vous pouvez également utiliser une vue métrique Unity Catalog comme source. Lorsque vous sélectionnez une vue métrique, sélectionnez les dimensions et les mesures à inclure, et Designer génère la query agrégée pour vous.
Pour toutes les options d'ingestion de données, y compris le ciblage d'un volume ou d'un dossier Unity Catalog entier, consultez Ingérer des données dans Lakeflow Designer.
Saisie des données
Crée une table en saisissant des valeurs dans un éditeur de type feuille de calcul. Utilisez cet opérateur pour ajouter de petites quantités de données de référence, telles que des valeurs de recherche ou des données de test, sans créer de table source distincte.
Champ | Description |
|---|---|
Données de la table | Saisissez vos données sous forme de tableau. La première ligne définit les en-têtes de colonne, et les lignes restantes constituent les données. Designer infère le type de données de chaque colonne à partir de ses valeurs. |
Résultat
Exporte les données de Designer. L'opérateur de sortie peut écrire les résultats dans une table Unity Catalog, les publier en tant que vue matérialisée, ou les écrire dans un fichier d'un volume Unity Catalog. Sélectionnez la destination avec le Type de sortie .
Type de sortie | Description |
|---|---|
Table | Écrit les résultats dans une table gérée Unity Catalog. Définissez un **nom de table** et un **emplacement de sortie** (catalogue et schéma), puis sélectionnez un **mode d'écriture**. |
Vue matérialisée | Publie les résultats sous forme de vue matérialisée dans Unity Catalog qui refresh lorsque la préparation visuelle des données s'exécute. |
Fichier | Écrit les résultats dans un fichier dans un volume Unity Catalog. Sélectionnez un **type de fichier** de CSV, Excel ou JSON, puis définissez le volume cible et le nom du fichier. |
Pour une sortie **Table** ou **Fichier**, sélectionnez la manière dont chaque exécution écrit vers la destination avec le **Mode d'écriture** :
Mode d'écriture | Description |
|---|---|
Remplacer | Remplace le contenu existant par les résultats de l'exécution actuelle. C'est le default. |
Ajouter | Ajoute les résultats de l'exécution actuelle aux lignes existantes. |
Merge | Insère ou met à jour des lignes dans la table cible en faisant correspondre les clés de Merge que vous spécifiez. Disponible pour les sorties de table. |
Cliquez sur Exécuter pour exécuter la préparation des données visuelles et écrire les résultats. Pour une sortie de table, si la table n'existe pas, l'opérateur la crée. Les exécutions planifiées écrivent vers la destination en utilisant le même mode d'écriture.
Fonction IA
Exécute une opération d'IA intégrée sur vos données. Dans le volet de configuration, ouvrez Sélectionner une fonction et sélectionnez l'une des fonctions dans le tableau suivant. Chaque fonction présente des options dans le volet pour les entrées (par exemple : colonnes, invites, étiquettes ou langues) et les sorties.
Fonction | Description |
|---|---|
| Effectue une analyse des sentiments sur le texte saisi. |
| Classe les textes ou les documents analysés à l'aide des étiquettes que vous fournissez. |
| Extrait des données structurées à partir de texte ou de documents analysés à l'aide de champs que vous définissez. |
| Corriger les erreurs grammaticales dans le texte. |
| Prévoit les données de séries chronologiques jusqu'à un horizon que vous spécifiez. |
| Répond à une invite fournie par l'utilisateur par rapport à l'entrée. |
| Masque les entités spécifiées dans le texte (par exemple, pour la désidentification). |
| Extrait le texte, les tableaux et la Layout de documents non structurés. |
| Transforme la sortie des documents analysés en blocs prêts à être recherchés pour la recherche vectorielle et les pipelines de génération augmentée de récupération (RAG). |
| Répond à une invite à l'aide de n'importe quel modèle de fondation pris en charge, pour les tâches à usage général et la flexibilité des modèles. |
| Compare deux chaînes de caractères et renvoie un score de similarité sémantique. |
| Génère un résumé de texte. |
| Traduit le texte dans une langue cible que vous spécifiez. |
Pour plus de détails sur chaque fonction, consultez Enrichir des données à l’aide des AI Functions.
Transformations
Les opérateurs suivants effectuent des transformations sur vos données.
Agréger
Récapitule les lignes en regroupant les données et en calculant les valeurs agrégées.
Champ | Description |
|---|---|
Agréger par | Sélectionnez une colonne, sélectionnez une fonction d'agrégation et indiquez un nom pour la colonne de sortie. Cliquez sur + Ajouter une agrégation pour en ajouter d’autres. Fonctions prises en charge : |
Regrouper par | Sélectionnez les colonnes à regrouper par. Cliquez sur + Ajouter un regroupement pour en ajouter davantage. Les colonnes utilisées dans Regrouper par sont automatiquement incluses dans la sortie. |
Combiner
Merge les données de plusieurs tables avec des schémas correspondants en une seule sortie.
Champ | Description |
|---|---|
Opération d'ensemble | Sélectionnez Union , Intersection ou À l'exception de . |
Merge strategy | Sélectionnez **Distinct** pour exclure les lignes dupliquées de la sortie, ou **All** pour conserver toutes les lignes, y compris les doublons. |
Filtrer
Divise les lignes selon qu'elles remplissent une ou plusieurs conditions, à l'aide d'un générateur de conditions graphique.
Champ | Description |
|---|---|
État | Pour chaque condition, sélectionnez une colonne , un type de condition et une valeur à faire correspondre de manière conditionnelle. Types de conditions pris en charge :
Pour les conditions sur les colonnes de date, le sélecteur de dates permet de naviguer entre les années et les mois. |
L'opérateur de filtre a deux sorties afin que vous puissiez Branch les données selon qu'elles remplissent les conditions :
Résultat | Description |
|---|---|
Inclus | Lignes qui satisfont aux conditions de filtre. |
Exclus | Les lignes qui ne répondent pas aux conditions de filtre, y compris les lignes où la condition est évaluée à null. |
Jointure
Link deux tables sur une clé en combinant deux datasets d'entrée basés sur des valeurs de colonne correspondantes.
Champ | Description |
|---|---|
Tables d’entrée | Sélectionnez les deux tables d'entrée à joindre. |
Condition de jointure | Spécifiez au moins une condition de jointure en sélectionnant les colonnes correspondantes des deux tables. Cliquez sur + Ajouter une expression de jointure pour ajouter d'autres conditions. Facultatif : cliquez sur la flèche entre les tables de gauche et de droite pour ajouter une condition de jointure personnalisée, puis modifiez la description générée par l'IA ou écrivez du SQL. |
Respecter la casse | Lorsque désactivé (default), les clés de jointure de chaîne ne respectent pas la casse (et ignorent les espaces blancs de début et de fin). Activez l'option **Respecter la casse** pour que les clés de chaîne correspondent exactement. Cette option s'applique aux clés de jointure, non aux conditions de jointure personnalisées. |
Type de jointure | Sélectionnez le type de jointure. By default, l'opérateur de jointure répartit ses résultats sur trois sorties (voir la section suivante). Sélectionnez Jointure complète , Jointure interne , Jointure gauche , ou Jointure droite pour produire une seule sortie jointe à la place. |
Colonnes de sortie | Facultatif : sélectionnez les colonnes à inclure. Par default, toutes les colonnes des deux tables sont incluses. Les noms de colonne en double reçoivent un préfixe de nom de table. |
Colonnes d'expression personnalisée | Facultatif : ajoutez des colonnes d'expression personnalisées basées sur le résultat joint. |
Par default, l'opérateur Join dispose de trois sorties, ce qui vous permet de Branch un workflow basé sur les résultats de la jointure :
Résultat | Description |
|---|---|
Non apparié à gauche | Lignes de l'entrée gauche qui n'ont pas de correspondance dans l'entrée droite. |
Correspondant | Lignes qui correspondent aux deux entrées. |
Droit non apparié | Lignes de l'entrée de droite qui n'ont pas de correspondance dans l'entrée de gauche. |
Lorsque vous sélectionnez un **type de jointure** spécifique (complet, interne, gauche ou droite), l'opérateur produit une sortie jointe unique au lieu des trois sorties scindées.
Limite
Limite le nombre de lignes en ne transmettant que jusqu'au nombre maximal de lignes que vous spécifiez.
Champ | Description |
|---|---|
Nombre maximal de lignes | Spécifiez le nombre maximal de lignes à faire transiter. |
Tableau croisé dynamique
Remodèle les données tabulaires dans deux directions. Utilisez les tabs en haut du volet de configuration pour sélectionner le mode.
Lignes → Colonnes (pivoter)
Transforme les valeurs distinctes d'une colonne en de nouveaux en-têtes de colonne, remplis de valeurs agrégées provenant d'une autre colonne.
Champ | Description |
|---|---|
Colonne pivotante | Sélectionnez la colonne dont les valeurs distinctes deviennent les nouveaux en-têtes. |
Valeur et agrégation | Sélectionnez la colonne dont les valeurs remplissent les cellules pivotées, et sélectionnez une fonction d'agrégation (par exemple, |
Colonnes → Lignes (dépivotement)
Convertit une ou plusieurs colonnes en lignes.
Champ | Description |
|---|---|
Annuler le pivotement des colonnes | Sélectionnez les colonnes à dépivoter. |
Colonnes de clé et de valeur | Définissez les noms des colonnes de clé et de valeur de sortie. |
Inclure les colonnes
Pour l'un ou l'autre mode, sélectionnez les colonnes qui restent dans la sortie aux côtés des valeurs pivotées ou non pivotées, et supprimez les colonnes dont vous n'avez pas besoin avant la transformation. Le concepteur déduit les colonnes fixes (de regroupement) des colonnes que vous n'attribuez pas aux rôles de pivot, de valeur ou de non-pivot.
Trier
Ordonne les lignes sur une ou plusieurs colonnes.
Champ | Description |
|---|---|
Ordre de tri | Sélectionnez **ASC** (croissant) ou **DESC** (décroissant) pour chaque colonne. Cliquez sur **+ Ajouter une expression de tri** pour trier par des colonnes supplémentaires. Le tri suit l'ordre lexical standard. |
SQL
Écrit du code SQL personnalisé pour toute transformation non couverte par les autres opérateurs.
Champ | Description |
|---|---|
Éditeur SQL | Saisissez une instruction SQL SQL Cliquez sur le bouton |
Paramètres | Pour référencer un paramètre de préparation de données visuelles, utilisez la syntaxe des marqueurs de paramètres nommé, tels que |
Sélectionner
Sélectionne, renomme et réorganise les colonnes des données d’entrée.
Champ | Description |
|---|---|
Inclure ou exclure des colonnes | Sélectionnez Start with all columns ou Start with no columns , puis utilisez les cases à cocher pour inclure ou exclure des colonnes individuelles. Faire glisser les colonnes pour les réorganiser. |
Renommer une colonne | Saisissez un nouveau nom dans le champ Renommer à côté de n’importe quelle colonne. |
Préparer
Nettoie et dérive les colonnes en enchaînant une ou plusieurs actions sur les données d'entrée. Cliquez sur + Ajouter une action et sélectionnez une action. Ajoutez autant d'actions que vous le souhaitez. Elles s'appliquent dans l'ordre.
Action | Description |
|---|---|
Formule | Créez une nouvelle colonne ou écrasez une colonne existante à l'aide du langage naturel ou d'une expression SQL. |
Changer le type | Convertir une colonne vers un autre type de données. |
Remplacer la valeur | Rechercher et remplacer des valeurs dans une colonne. |
Remplir les valeurs nulles | Remplacez les valeurs nulles par une constante. |
Casse du texte | Modifier la casse en minuscules, majuscules ou titre. |
Tronquer | Supprimer les espaces à une ou aux deux extrémités. |
Remplacement Regex | Remplacer le texte correspondant à un modèle regex. |
Extraire | Extraire une sous-chaîne correspondant à un groupe regex. |
Analyser la date | Analyser une chaîne en date ou en Timestamp. |
Pour supprimer une action, survolez sa ligne et cliquez sur .
Colonnes personnalisées
L'action Formule ouvre l'éditeur d'expressions, où vous pouvez créer une nouvelle colonne ou écraser une colonne existante en utilisant le langage naturel ou le code SQL. L'éditeur a deux zones de saisie et est bidirectionnel :
- Description : tapez une description en langage naturel de ce que vous voulez que la colonne fasse. Designer utilise Genie pour générer l'expression de code correspondante ci-dessous.
- Expression : si vous préférez écrire ou modifier du code directement, cliquez sur le bouton de modification de l'expression. La modification de l’expression génère automatiquement une description en langage naturel.
Python
Exécute du code Python personnalisé (PySpark) sur les données d'entrée.
Champ | Description |
|---|---|
| Attribuez un seul DataFrame à |
| Une liste de DataFrames d'entrée, en ordre amont. Le volet des détails de l'opérateur affiche le nom de chaque entrée, dans l'ordre. Par exemple, |
Paramètres | Appelez |
Un modèle minimal consiste à utiliser la première entrée si elle est présente, ou un DataFrame vide sinon :
# inputs["data"] is a list of input DataFrames
result = inputs["data"][0] if inputs["data"] else spark.createDataFrame([], "col: string")
À partir de là, vous pouvez enchaîner les opérations de DataFrame (par exemple, select, filter, withColumn ou les jointures) sur result avant la fin de l'affectation, ou remplacer result par un nouveau DataFrame créé à partir de inputs["data"].
Organisation
Note
Ajoute une note sur le canevas afin que vous puissiez documenter le workflow lui-même : son objectif, ses hypothèses, ses mises en garde ou le contexte de transfert pour toute personne qui ouvrira la préparation visuelle des données plus tard.
Champ | Description |
|---|---|
Contenu | Modifiez le contenu des notes directement sur le canevas avec un éditeur de texte enrichi. Vous pouvez ajouter des titres, la mise en forme du texte, des Link, des images et des tableaux là où le texte brut n'est pas suffisant. Les notes n'affectent pas la façon dont les données circulent par les opérateurs. |
Groupe
Regroupe visuellement les opérateurs sur le canevas sans modifier la façon dont les données circulent entre eux, ce qui est utile lorsqu'une préparation visuelle des données devient volumineuse ou que vous souhaitez refléter des étapes logiques.
Champ | Description |
|---|---|
Ajouter au groupe | Faites glisser un ou plusieurs opérateurs sur un groupe pour les y ajouter. |
Créer à partir de la sélection | Sélectionnez un ou plusieurs opérateurs, ouvrez le menu contextuel (clic droit), et sélectionnez Créer un nouveau groupe pour envelopper la sélection dans un nouveau groupe. |
Nom | Donnez un nom descriptif au groupe. |
Réduire / agrandir | Cliquez sur **réduire** ou **agrandir** pour afficher ou masquer le contenu du groupe sur la toile. |
Visualisation
Crée une visualisation à partir des données d'entrée et l'affiche directement sur la zone de travail. Connectez un opérateur de visualisation à tout opérateur produisant des données tabulaires pour visualiser les résultats sans quitter Designer.
Pour configurer la visualisation, ouvrez l'opérateur et sélectionnez un type de Visualisation , puis mappez vos colonnes au graphique.
Champ | Description |
|---|---|
Visualisation | Le type de graphique à rendre, tel que **barres**, **aires**, ou **compteur**. |