Opérateurs intégrés dans Lakeflow Designer
Lakeflow Designer comprend des opérateurs intégrés pour les tâches courantes de préparation et de transformations de données. Ouvrez le menu de l'opérateur dans le panneau latéral gauche pour parcourir les opérateurs par catégorie, ou utilisez Rechercher un opérateur… en haut du panneau. La recherche d'opérateur suggère des opérateurs en fonction de votre intention. Par exemple, la saisie de average by month renvoie l'opérateur Agrégat . Pour configurer un opérateur après l'avoir ajouté au canevas, double-cliquez dessus, ou survolez-le et cliquez sur ( Modifier l'opérateur ), pour ouvrir le panneau de configuration.

Chaque opérateur affiche une description générée par l'IA de ce qu'il fait. La description agit également comme un éditeur pour l'opérateur : la modification de la description reconfigure l'opérateur afin qu'il corresponde à votre description.
Pour découvrir comment créer vos propres opérateurs définis par l’utilisateur, consultez Opérateurs définis par l’utilisateur dans Lakeflow Designer.
Source et sortie
Source
Importe les données dans Designer depuis une table Unity Catalog ou une autre source prise en charge. Pour sélectionner une source, recherchez une table ou un fichier par nom, ou naviguez par catalogue et schéma. Vous pouvez également créer une nouvelle table à partir de ce volet.
Après avoir sélectionné une table, le volet affiche le nom de la table, son propriétaire et l'heure de la dernière mise à jour. Cliquez sur Sélectionner une nouvelle source de données pour changer la source. La modification de la source invalide le cache de sortie pour tous les opérateurs en aval.
Vous pouvez également utiliser une vue métrique Unity Catalog comme source. Lorsque vous sélectionnez une vue métrique, sélectionnez les dimensions et les mesures à inclure, et Designer génère la query agrégée pour vous.
Pour toutes les options d'ingestion de données, y compris le ciblage d'un volume ou d'un dossier Unity Catalog entier, consultez Ingérer des données dans Lakeflow Designer.
Saisie des données
Crée une table en saisissant des valeurs dans un éditeur de type feuille de calcul. Utilisez cet opérateur pour ajouter de petites quantités de données de référence, telles que des valeurs de recherche ou des données de test, sans créer de table source distincte.
Champ | Description |
|---|---|
Données de la table | Saisissez vos données sous forme de tableau. La première ligne définit les en-têtes de colonne, et les lignes restantes constituent les données. Designer infère le type de données de chaque colonne à partir de ses valeurs. |
Résultat
Exporte les données de Designer. L'opérateur de sortie peut écrire les résultats dans une table Unity Catalog, les publier en tant que vue matérialisée, ou les écrire dans un fichier d'un volume Unity Catalog. Sélectionnez la destination avec le Type de sortie .
Type de sortie | Description |
|---|---|
Table | Écrit les résultats dans une table gérée Unity Catalog. Définissez un **nom de table** et un **emplacement de sortie** (catalogue et schéma), puis sélectionnez un **mode d'écriture**. |
Vue matérialisée | Publie les résultats sous forme de vue matérialisée dans Unity Catalog qui refresh lorsque la préparation visuelle des données s'exécute. |
Fichier | Écrit les résultats dans un fichier dans un volume Unity Catalog. Sélectionnez un **type de fichier** de CSV, Excel ou JSON, puis définissez le volume cible et le nom du fichier. |
Pour une sortie **Table** ou **Fichier**, sélectionnez la manière dont chaque exécution écrit vers la destination avec le **Mode d'écriture** :
Mode d'écriture | Description |
|---|---|
Remplacer | Remplace le contenu existant par les résultats de l'exécution actuelle. C'est le default. |
Ajouter | Ajoute les résultats de l'exécution actuelle aux lignes existantes. |
Merge | Insère ou met à jour des lignes dans la table cible en faisant correspondre les clés de Merge que vous spécifiez. Disponible pour les sorties de table. |
Cliquez sur Exécuter pour exécuter la préparation des données visuelles et écrire les résultats. Pour une sortie de table, si la table n'existe pas, l'opérateur la crée. Les exécutions planifiées écrivent vers la destination en utilisant le même mode d'écriture.
Fonction IA
Exécute une opération d'IA intégrée sur vos données. Dans le volet de configuration, ouvrez Sélectionner une fonction et sélectionnez l'une des fonctions dans le tableau suivant. Chaque fonction présente des options dans le volet pour les entrées (par exemple : colonnes, invites, étiquettes ou langues) et les sorties.
Fonction | Description |
|---|---|
| Effectue une analyse des sentiments sur le texte saisi. |
| Classe les textes ou les documents analysés à l'aide des étiquettes que vous fournissez. |
| Extrait des données structurées à partir de texte ou de documents analysés à l'aide de champs que vous définissez. |
| Corriger les erreurs grammaticales dans le texte. |
| Prévoit les données de séries chronologiques jusqu'à un horizon et une fréquence que vous spécifiez. |
| Répond à une invite fournie par l'utilisateur par rapport à l'entrée. |
| Masque les entités spécifiées dans le texte (par exemple, pour la désidentification). |
| Extrait le texte, les tableaux et la Layout de documents non structurés. |
| Transforme la sortie des documents analysés en blocs prêts à être recherchés pour la recherche vectorielle et les pipelines de génération augmentée de récupération (RAG). |
| Répond à une invite à l'aide de n'importe quel modèle de fondation pris en charge, pour les tâches à usage général et la flexibilité des modèles. |
| Compare deux chaînes de caractères et renvoie un score de similarité sémantique. |
| Génère un résumé de texte. |
| Traduit le texte dans une langue cible que vous spécifiez. |
Pour plus de détails sur chaque fonction, consultez Transformer des données non structurées à l'aide des AI Functions.
Transformations
Les opérateurs suivants effectuent des transformations sur vos données.
Agréger
Récapitule les lignes en regroupant les données et en calculant les valeurs agrégées.
Champ | Description |
|---|---|
Agréger par | Sélectionnez une colonne, sélectionnez une fonction d’agrégation et indiquez un nom pour la colonne de sortie. Cliquez sur + Ajouter une agrégation pour en ajouter davantage. Fonctions prises en charge : |
Regrouper par | Sélectionnez les colonnes à regrouper par. Cliquez sur + Ajouter un regroupement pour en ajouter davantage. Les colonnes utilisées dans Regrouper par sont automatiquement incluses dans la sortie. |
Combiner
Combine les données de plusieurs tables en une seule sortie en utilisant une opération ensembliste.
Champ | Description |
|---|---|
Opération d'ensemble | Sélectionnez Union , Intersection ou À l'exception de . |
Merge strategy | Sélectionnez **Distinct** pour exclure les lignes dupliquées de la sortie, ou **All** pour conserver toutes les lignes, y compris les doublons. |
Relier par nom | Pour Union , sélectionnez Union by name sous Advanced pour faire correspondre les colonnes par nom plutôt que par position. |
Autoriser les colonnes manquantes | Pour Union , sélectionnez d’abord Relier par nom , puis sélectionnez Autoriser les colonnes manquantes pour remplir les colonnes absentes d’une entrée avec des valeurs nulles. Si cette option est désactivée, chaque entrée doit contenir le même ensemble de colonnes. |
Unique
Supprime les lignes en double des données d’entrée. By default, l’opérateur élimine les doublons sur toutes les colonnes. Vous pouvez plutôt choisir un sous-ensemble de colonnes comme clé et trier les lignes pour contrôler quel doublon est conservé.
Champ | Description |
|---|---|
Unique par | Sélectionnez Toutes les colonnes pour supprimer les lignes identiques dans toutes les colonnes, ou Colonnes sélectionnées pour supprimer les lignes qui sont des doublons uniquement dans les colonnes que vous choisissez comme clé. |
Trier par | Facultatif : sélectionnez une ou plusieurs colonnes et une direction de tri pour contrôler quelle ligne est conservée pour chaque ensemble de doublons. Si vous ne définissez pas d'ordre, l'opérateur conserve la première ligne qu'il rencontre. |
Filtrer
Divise les lignes selon qu'elles remplissent une ou plusieurs conditions, à l'aide d'un générateur de conditions graphique.
Champ | Description |
|---|---|
État | Pour chaque condition, sélectionnez une colonne , un type de condition et une valeur à faire correspondre de manière conditionnelle. Types de conditions pris en charge :
Pour les conditions sur les colonnes de date, le sélecteur de dates permet de naviguer entre les années et les mois. Lorsqu'une condition correspond aux valeurs d'une colonne (par exemple, Est l'un des ), la liste de valeurs affiche un échantillon des valeurs distinctes de la colonne en fonction de l'entrée. Sélectionnez Charger plus pour récupérer des valeurs supplémentaires à la demande. |
L'opérateur de filtre a deux sorties afin que vous puissiez Branch les données selon qu'elles remplissent les conditions :
Résultat | Description |
|---|---|
Inclus | Lignes qui satisfont aux conditions de filtre. |
Exclus | Les lignes qui ne répondent pas aux conditions de filtre, y compris les lignes où la condition est évaluée à null. |
Garde-fous
Valide les données entrantes par rapport à une liste ordonnée de vérifications et sépare les lignes valides des lignes en échec.
Champ | Description |
|---|---|
Vérifications | Ajoutez des contrôles Required columns , Row count , Not null , Unique , Accepted values , Disallowed values , Value range , Regex match ou Expression . |
Lorsqu’un contrôle échoue | Choisissez l'une des trois options pour contrôler la sortie et le comportement en aval. |
-
Avertir et continuer avec les lignes validées :
- L’exécution en aval se poursuit.
- Les lignes qui réussissent toutes les vérifications activées sont envoyées vers Réussite .
- Les lignes qui échouent à au moins un contrôle activé sont envoyées vers Échoué .
- Errors contient une ligne pour chaque vérification ayant échoué, incluant son type, sa sévérité et son message.
-
Sortie validée avec avertissement et blocage :
- Si une vérification échoue, l'exécution en aval se poursuit, mais Passed ne contient aucune ligne.
- Échec contient toujours les lignes en échec, et Erreurs contient toujours les détails de l’échec.
- Utilisez cette option pour empêcher le traitement en aval des lignes validées tout en autorisant le traitement en aval des statuts Failed et Errors .
-
Échouer le workflow :
- Si une vérification échoue, l'exécution s'arrête avant que les opérateurs en aval ne s'exécutent.
- Elles ne reçoivent pas les sorties Passed , Failed ou Errors .
- Dans un Job planifié, l'exécution est marquée comme ayant échoué, ce qui peut Trigger la gestion des échecs configurée, telle que les notifications de Job.
Lorsque vous prévisualisez l'opérateur Guardrails lui-même, vous pouvez toujours inspecter les trois sorties en mode Fail the workflow .
Pour conserver les lignes d'une sortie dans l'un ou l'autre des modes d'avertissement, connectez-la à un opérateur de sortie.
Jointure
Link les tables en combinant les dataset d'entrée sur la base de valeurs de colonnes correspondantes.
Champ | Description |
|---|---|
Tables d’entrée | Sélectionnez les deux tables d'entrée à joindre. Pour joindre trois tables ou plus, développez Advanced options , sélectionnez Join more than two tables , puis cliquez sur Add input pour chaque table supplémentaire. |
Condition de jointure | Spécifiez au moins une condition de jointure en sélectionnant des colonnes correspondantes dans deux tables. Cliquez sur + Ajouter une expression de jointure pour ajouter d’autres conditions. Facultatif : cliquez sur la flèche entre deux tables pour ajouter une condition de jointure personnalisée, puis modifiez la description générée par l’IA ou rédigez du SQL. S’il y a trois entrées ou plus, chaque table ajoutée doit définir une relation avec une autre entrée. |
Respecter la casse | Lorsque désactivé (default), les clés de jointure de chaîne ne respectent pas la casse (et ignorent les espaces blancs de début et de fin). Activez l'option **Respecter la casse** pour que les clés de chaîne correspondent exactement. Cette option s'applique aux clés de jointure, non aux conditions de jointure personnalisées. |
Type de jointure | Pour deux tables d’entrée, sélectionnez le type de jointure. Par default, l’opérateur de jointure répartit ses résultats sur trois sorties (voir la section suivante). Sélectionnez Full join , Inner join , Left join ou Right join pour produire à la place une seule sortie jointe. Avec trois entrées ou plus, l’opérateur suit les relations de table configurées, utilise des jointures internes et produit une seule sortie jointe. |
Colonnes de sortie | Facultatif : sélectionnez les colonnes à inclure. By default, les colonnes de chaque table d'entrée sont incluses. Avec deux entrées, les noms en double de la table de droite reçoivent un préfixe |
Colonnes d'expression personnalisée | Facultatif : ajoutez des colonnes d'expression personnalisées basées sur le résultat joint. |
Avec deux entrées, l'opérateur Join a trois sorties default afin de pouvoir Branch un workflow sur la base des résultats de la jointure :
Résultat | Description |
|---|---|
Non apparié à gauche | Lignes de l'entrée gauche qui n'ont pas de correspondance dans l'entrée droite. |
Correspondant | Lignes qui correspondent aux deux entrées. |
Droit non apparié | Lignes de l'entrée de droite qui n'ont pas de correspondance dans l'entrée de gauche. |
Avec deux entrées, la sélection d'un type de jointure spécifique (externe, interne, à gauche ou à droite) produit une seule sortie jointe au lieu des trois sorties fractionnées.
Limite
Limite le nombre de lignes en ne transmettant que jusqu'au nombre maximal de lignes que vous spécifiez.
Champ | Description |
|---|---|
Nombre maximal de lignes | Spécifiez le nombre maximal de lignes à faire transiter. |
Tableau croisé dynamique
Remodèle les données tabulaires dans deux directions. Utilisez les tabs en haut du volet de configuration pour sélectionner le mode.
Lignes → Colonnes (pivoter)
Transforme les valeurs distinctes d'une colonne en de nouveaux en-têtes de colonne, remplis de valeurs agrégées provenant d'une autre colonne.
Champ | Description |
|---|---|
Colonne pivotante | Sélectionnez la colonne dont les valeurs distinctes deviennent les nouveaux en-têtes. |
Valeur et agrégation | Sélectionnez la colonne dont les valeurs remplissent les cellules croisées et sélectionnez une fonction d'agrégation. Les fonctions disponibles dépendent du type de données de la colonne sélectionnée :
Configurez la manière dont les valeurs manquantes sont traitées (par exemple, null ou zéro), si l'option est disponible dans le volet. |
Colonnes → Lignes (dépivotement)
Convertit une ou plusieurs colonnes en lignes.
Champ | Description |
|---|---|
Annuler le pivotement des colonnes | Sélectionnez les colonnes à dépivoter. |
Colonnes de clé et de valeur | Définissez les noms des colonnes de clé et de valeur de sortie. |
Inclure les colonnes
Pour l'un ou l'autre mode, sélectionnez les colonnes qui restent dans la sortie aux côtés des valeurs pivotées ou non pivotées, et supprimez les colonnes dont vous n'avez pas besoin avant la transformation. Le concepteur déduit les colonnes fixes (de regroupement) des colonnes que vous n'attribuez pas aux rôles de pivot, de valeur ou de non-pivot.
Trier
Ordonne les lignes sur une ou plusieurs colonnes.
Champ | Description |
|---|---|
Ordre de tri | Sélectionnez **ASC** (croissant) ou **DESC** (décroissant) pour chaque colonne. Cliquez sur **+ Ajouter une expression de tri** pour trier par des colonnes supplémentaires. Le tri suit l'ordre lexical standard. |
SQL
Écrit du code SQL personnalisé pour toute transformation non couverte par les autres opérateurs.
Champ | Description |
|---|---|
Éditeur SQL | Saisissez une instruction SQL SQL Cliquez sur le bouton |
Paramètres | Pour référencer un paramètre de préparation de données visuelles, utilisez la syntaxe des marqueurs de paramètres nommé, tels que |
Sélectionner
Sélectionne, renomme et réorganise les colonnes des données d’entrée.
Champ | Description |
|---|---|
Inclure ou exclure des colonnes | Sélectionnez Start with all columns ou Start with no columns , puis utilisez les cases à cocher pour inclure ou exclure des colonnes individuelles. Faire glisser les colonnes pour les réorganiser. |
Renommer une colonne | Saisissez un nouveau nom dans le champ Renommer à côté de n’importe quelle colonne. |
Sélectionner des colonnes dynamiquement | Au lieu de choisir les colonnes individuellement, sélectionnez-les selon une règle afin que la sortie s’adapte à mesure que le schéma d’entrée change. Choisissez de conserver les colonnes correspondantes ou de supprimer les colonnes correspondantes , puis faites correspondre les colonnes par :
|
Préparer
Nettoie et dérive les colonnes en enchaînant une ou plusieurs actions sur les données d'entrée. Cliquez sur + Ajouter une action et sélectionnez une action. Ajoutez autant d'actions que vous le souhaitez. Elles s'appliquent dans l'ordre.
Action | Description |
|---|---|
Formule | Créez une nouvelle colonne ou écrasez une colonne existante à l'aide du langage naturel ou d'une expression SQL. |
Changer le type | Convertir une colonne vers un autre type de données. |
Remplacer la valeur | Rechercher et remplacer des valeurs dans une colonne. |
Remplir les valeurs nulles | Remplacez les valeurs nulles par une constante. |
Casse du texte | Modifier la casse en minuscules, majuscules ou titre. |
Tronquer | Supprimer les espaces à une ou aux deux extrémités. |
Remplacement Regex | Remplacer le texte correspondant à un modèle regex. |
Extraire | Extraire une sous-chaîne correspondant à un groupe regex. |
Analyser la date | Analyser une chaîne en date ou en Timestamp. |
Pour supprimer une action, survolez sa ligne et cliquez sur .
Colonnes personnalisées
L'action Formule ouvre l'éditeur d'expressions, où vous pouvez créer une nouvelle colonne ou écraser une colonne existante en utilisant le langage naturel ou le code SQL. L'éditeur a deux zones de saisie et est bidirectionnel :
- Description : tapez une description en langage naturel de ce que vous voulez que la colonne fasse. Designer utilise Genie pour générer l'expression de code correspondante ci-dessous.
- Expression : si vous préférez écrire ou modifier du code directement, cliquez sur le bouton de modification de l'expression. La modification de l’expression génère automatiquement une description en langage naturel.
Dans l’éditeur d’expressions, tapez @ pour ouvrir un menu des colonnes d’entrée de l’opérateur et des fonctions SQL intégrées. Tapez après @ pour filtrer la liste, puis sélectionnez une entrée pour l’insérer : une colonne insère son nom, et une fonction insère son appel avec le curseur placé à l’intérieur des parenthèses. Le même menu @ est disponible dans les éditeurs d’expressions d’autres opérateurs, tels que les conditions personnalisées de filtre et de jointure.
Python
Exécute du code Python personnalisé (PySpark) sur les données d'entrée.
Champ | Description |
|---|---|
| Attribuez un seul DataFrame à |
| Une liste de DataFrames d'entrée, en ordre amont. Le volet des détails de l'opérateur affiche le nom de chaque entrée, dans l'ordre. Par exemple, |
Paramètres | Appelez |
Un modèle minimal consiste à utiliser la première entrée si elle est présente, ou un DataFrame vide sinon :
# inputs["data"] is a list of input DataFrames
result = inputs["data"][0] if inputs["data"] else spark.createDataFrame([], "col: string")
À partir de là, vous pouvez enchaîner les opérations de DataFrame (par exemple, select, filter, withColumn ou les jointures) sur result avant la fin de l'affectation, ou remplacer result par un nouveau DataFrame créé à partir de inputs["data"].
Pendant un aperçu, la sortie de l'opérateur est transmise dans le volet de sortie au fur et à mesure de sa production, y compris tout ce que vous rendez avec display() et le texte que vous imprimez, afin que vous puissiez voir les résultats avant la fin de l'exécution.
Mode de prévisualisation Python
Pendant que vous créez une préparation de données visuelles, Designer prévisualise en continu la sortie de chaque opérateur sur un échantillon de vos données. Ces aperçus exécutent votre code Python de la même manière qu’une exécution complète. C’est un problème lorsque votre code a des effets secondaires, comme l’appel d’une API externe, l’envoi d’une notification ou l’écriture dans un système en dehors de Unity Catalog. Vous ne souhaitez généralement pas que ces effets secondaires se déclenchent à chaque aperçu.
Pour permettre à votre code de les distinguer, lisez config["is_preview"], un booléen que Designer définit pour vous :
Truependant une exécution d’aperçu, afin que vous puissiez ignorer les effets secondaires.Falselors d’une exécution complète, par exemple lorsque vous cliquez sur Exécuter ou lors d’une exécution planifiée.
Par exemple, protégez les effets secondaires afin qu'ils ne s'exécutent qu'en dehors des aperçus :
result = inputs["data"][0] if inputs["data"] else spark.createDataFrame([], "col: string")
# Side effects run only on a full run or scheduled job, not during previews.
if not config["is_preview"]:
write_results_to_external_system(result)
Organisation
Note
Ajoute une note sur le canevas afin que vous puissiez documenter le workflow lui-même : son objectif, ses hypothèses, ses mises en garde ou le contexte de transfert pour toute personne qui ouvrira la préparation visuelle des données plus tard.
Champ | Description |
|---|---|
Contenu | Modifiez le contenu des notes directement sur le canevas avec un éditeur de texte enrichi. Vous pouvez ajouter des titres, la mise en forme du texte, des Link, des images et des tableaux là où le texte brut n'est pas suffisant. Les notes n'affectent pas la façon dont les données circulent par les opérateurs. |
Groupe
Regroupe visuellement les opérateurs sur le canevas sans modifier la façon dont les données circulent entre eux, ce qui est utile lorsqu'une préparation visuelle des données devient volumineuse ou que vous souhaitez refléter des étapes logiques.
Champ | Description |
|---|---|
Ajouter au groupe | Faites glisser un ou plusieurs opérateurs sur un groupe pour les y ajouter. |
Créer à partir de la sélection | Sélectionnez un ou plusieurs opérateurs, ouvrez le menu contextuel (clic droit), et sélectionnez Créer un nouveau groupe pour envelopper la sélection dans un nouveau groupe. |
Nom | Donnez un nom descriptif au groupe. |
Réduire / agrandir | Cliquez sur **réduire** ou **agrandir** pour afficher ou masquer le contenu du groupe sur la toile. |
Activer / désactiver | Faites un clic droit sur l’en-tête du groupe et sélectionnez Désactiver pour exclure tous les opérateurs du groupe des exécutions, ou Activer pour les inclure à nouveau. Les opérateurs désactivés ne produisent aucune ligne de sortie ; les opérateurs en aval reçoivent donc un résultat vide jusqu’à ce que vous les activiez. Vous pouvez également activer ou désactiver un opérateur individuel. Voir Activer ou désactiver les opérateurs. |
Visualisation
Crée une visualisation à partir des données d'entrée et l'affiche directement sur la zone de travail. Connectez un opérateur de visualisation à tout opérateur produisant des données tabulaires pour visualiser les résultats sans quitter Designer.
Pour configurer la visualisation, ouvrez l'opérateur et sélectionnez un type de Visualisation , puis mappez vos colonnes au graphique.
Champ | Description |
|---|---|
Visualisation | Le type de graphique à rendre, tel que **barres**, **aires**, ou **compteur**. |