Opérateurs intégrés dans Lakeflow Designer
Lakeflow Designer comprend des opérateurs intégrés pour les tâches courantes de préparation et de transformation des données. Ouvrez le menu de l'opérateur dans le volet latéral gauche pour parcourir les opérateurs par catégorie, ou utilisez Rechercher un opérateur… en haut du volet. La recherche d'opérateur suggère des opérateurs en fonction de votre intention. Par exemple, la saisie de average by month renvoie l'opérateur Agrégat . Pour ouvrir le volet de configuration d’un opérateur après l’avoir ajouté à la toile, double-cliquez dessus ou maintenez le pointeur dessus et cliquez sur ( Modifier l’opérateur ).

Chaque opérateur affiche une description générée par l'IA de ce qu'il fait. La description agit également comme un éditeur pour l'opérateur : la modification de la description reconfigure l'opérateur afin qu'il corresponde à votre description.
Pour découvrir comment créer vos propres opérateurs définis par l’utilisateur, consultez Opérateurs définis par l’utilisateur dans Lakeflow Designer.
Source et sortie
Source
Importe les données dans Designer depuis une table Unity Catalog ou une autre source prise en charge. Pour sélectionner une source, recherchez une table ou un fichier par nom, ou naviguez par catalogue et schéma. Vous pouvez également créer une nouvelle table à partir de ce volet.
Après avoir sélectionné une table, le volet affiche le nom de la table, son propriétaire et l'heure de la dernière mise à jour. Cliquez sur Sélectionner une nouvelle source de données pour changer la source. La modification de la source invalide le cache de sortie pour tous les opérateurs en aval.
Pour l'éventail complet des options d'importation de données, consultez Importer des données dans Lakeflow Designer.
Résultat
Exporte des données depuis Designer en écrivant les résultats dans une table Unity Catalog.
Dans le volet de configuration de la sortie, spécifiez :
- Nom de la table : Le nom de la table à créer.
- Emplacement de sortie : le catalogue et le schéma où la table est créée.
Cliquez sur Run pour exécuter la préparation des données visuelles et écrire les résultats. Chaque exécution écrit une table gérée par Unity Catalog. Si la table n'existe pas, l'opérateur la crée. Si c'est le cas, l'exécution remplace son contenu. Les exécutions programmées remplacent la table de la même manière, de sorte que la sortie reflète la dernière exécution plutôt que d'ajouter des lignes.
Fonction IA
Exécute une opération d'IA intégrée sur vos données. Dans le volet de configuration, ouvrez Sélectionner une fonction et choisissez l'une des fonctions ci-dessous. Chaque fonction expose des options dans le volet pour les entrées (par exemple, colonnes, invites, étiquettes ou langues) et les sorties.
Pour plus de détails sur chaque fonction, consultez Enrichir des données à l’aide des AI Functions.
Fonction | Description |
|---|---|
| Effectue une analyse des sentiments sur le texte saisi. |
| Classe les textes ou les documents analysés à l'aide des étiquettes que vous fournissez. |
| Extrait des données structurées à partir de texte ou de documents analysés à l'aide de champs que vous définissez. |
| Corriger les erreurs grammaticales dans le texte. |
| Répond à une invite fournie par l'utilisateur par rapport à l'entrée. |
| Masque les entités spécifiées dans le texte (par exemple, pour la désidentification). |
| Compare deux chaînes de caractères et renvoie un score de similarité sémantique. |
| Génère un résumé de texte. |
| Traduit le texte dans une langue cible que vous spécifiez. |
Transformations
Les opérateurs suivants effectuent des transformations sur vos données.
Agréger
Récapitule les lignes en regroupant les données et en calculant les valeurs agrégées.
- Agréger par : Sélectionnez une colonne, choisissez une fonction d'agrégation et indiquez un nom pour la colonne de sortie. Cliquez sur + Ajouter une agrégation pour en ajouter d'autres.
- Regrouper par : sélectionnez les colonnes à regrouper. Cliquez sur **+ Ajouter un groupe** pour en ajouter davantage.
Fonctions d'agrégation prises en charge : AVG, COUNT, MAX, MEAN, MEDIAN, MIN, PERCENTILE, STDDEV, SUM, VARIANCE.
Les colonnes utilisées dans Group by sont automatiquement incluses dans la sortie.
Combiner
Merge les données de plusieurs tables avec des schémas correspondants en une seule sortie.
- Opération d’ensemble : Choisissez Union , Intersection ou Sauf .
- **Stratégie de Merge** : Choisissez **Distinct** pour exclure les lignes en double de la sortie, ou **All** pour conserver toutes les lignes, y compris les doublons.
Filtrer
Sélectionne les lignes correspondantes en ne conservant que les lignes qui remplissent une ou plusieurs conditions, à l'aide d'un générateur de conditions graphique. Pour chaque condition, sélectionnez une *colonne*, un *type de condition* et une *valeur* à faire correspondre de manière conditionnelle.
Types de conditions pris en charge :
- Est égal à / N'est pas égal à
- Fait partie de / Ne fait pas partie de
- Contient / Ne contient pas
- Starts with / Does not start with
- Se termine par / Ne se termine pas par
- Supérieur à / Inférieur à
- Est nul / N'est pas nul
Jointure
Link deux tables sur une clé en combinant deux datasets d'entrée basés sur des valeurs de colonne correspondantes.
Pour configurer une Jointure :
- Sélectionnez les deux tables d'entrée à joindre.
- Spécifiez au moins une condition de jointure en sélectionnant les colonnes correspondantes dans les deux tables. Cliquez sur + Ajouter une expression de jointure pour ajouter plus de conditions.
- Facultatif : ajoutez une condition de jointure personnalisée en cliquant sur la flèche entre les tables de gauche et de droite. Modifiez la description générée par l’IA ou écrivez du SQL pour configurer la condition.
- Sélectionnez le type de jointure : Jointure complète , Jointure interne , Jointure gauche ou Jointure droite .
- Facultatif : choisissez les colonnes à inclure dans le résultat. Par default, toutes les colonnes des deux tables sont incluses. Les noms de colonne en double reçoivent un préfixe de nom de table.
- Facultatif : Ajoutez des colonnes d’expression personnalisées basées sur le résultat joint.
Limite
Limite le nombre de lignes en ne transmettant que jusqu'au nombre maximal de lignes que vous spécifiez.
Tableau croisé dynamique
Remodèle les données tabulaires dans deux directions. Utilisez les tab en haut du volet de configuration pour choisir le mode.
Lignes → Colonnes (pivoter)
Transforme les valeurs distinctes d'une colonne en de nouveaux en-têtes de colonne, remplis de valeurs agrégées provenant d'une autre colonne.
- Colonne de tableau croisé dynamique : choisissez la colonne dont les valeurs distinctes deviennent les nouveaux en-têtes.
- Valeur et agrégation : Choisissez la colonne dont les valeurs remplissent les cellules pivotées et sélectionnez une fonction d’agrégation (par exemple,
SUM,AVG,COUNT,MIN, ouMAX). Configurez la manière dont les valeurs manquantes sont gérées (par exemple, nulles ou égales à zéro), si disponible dans le volet.
Colonnes → Lignes (dépivotement)
Convertit une ou plusieurs colonnes en lignes.
- Annuler le pivotement des colonnes : sélectionnez les colonnes à annuler le pivotement.
- Colonnes clé et de valeur : Définissez les noms des colonnes clé et de valeur de sortie.
Inclure les colonnes
Pour l'un ou l'autre mode, choisissez les colonnes qui restent dans la sortie avec les valeurs pivotées ou non pivotées, et supprimez les colonnes dont vous n'avez pas besoin avant la transformation. Le Designer déduit les colonnes fixes (de regroupement) à partir des colonnes que vous n'attribuez pas aux rôles de pivot, de valeur ou de non-pivot.
Trier
Classe les lignes sur une ou plusieurs colonnes. Pour chaque colonne, choisissez ASC (croissant) ou DESC (décroissant). Cliquez sur + Ajouter une expression de tri pour trier par des colonnes supplémentaires. Le tri suit l'ordre lexical standard.
SQL
Écrit du code SQL personnalisé pour toute transformation non couverte par les autres opérateurs.
Saisissez une instruction SQL SELECT dans l'éditeur. Pour référencer la sortie d’un opérateur d’entrée, utilisez le nom de cet opérateur comme nom de table dans votre requête. Par exemple :
SELECT COUNT(*)
FROM aggregate_2
WHERE 1 = 1
Cliquez sur le bouton dans l'éditeur pour ouvrir le volet complet du code SQL et voir comment votre instruction s'intègre dans le workflow complet.
Pour référencer un paramètre de préparation visuelle des données, utilisez la syntaxe des marqueurs de paramètre nommés, telle que :environment. Lorsque vous ouvrez l’opérateur pour modification, Designer affiche un exemple au-dessus de l’éditeur. See parameter.
Sélectionner
Sélectionne, renomme et réorganise les colonnes des données d’entrée.
- Inclure ou exclure des colonnes : Choisissez start with all columns ou start with no columns , puis cochez les cases pour inclure ou exclure des colonnes individuelles. Faites glisser les colonnes pour les réorganiser.
- Renommer une colonne : Saisissez un nouveau nom dans le champ Renommer à côté de n'importe quelle colonne.
Préparer
Nettoie et dérive les colonnes en enchaînant une ou plusieurs actions sur les données d'entrée. Cliquez sur + Ajouter une action et choisissez une action. Ajoutez autant d'actions que nécessaire. Ils s'appliquent dans l'ordre.
- Formule : Créez une nouvelle colonne ou écrasez une colonne existante à l’aide du langage naturel ou d’une expression SQL.
- Changer le type : Convertissez une colonne en un autre type de données.
- Remplacer la valeur : Rechercher et remplacer des valeurs dans une colonne.
- Remplir les valeurs nulles : remplacez les valeurs nulles par une constante.
- Casse du texte : modifier la casse en minuscules, majuscules ou titre.
- Rogner : Supprimer les espaces blancs d'une ou des deux extrémités.
- Remplacement par Regex : Remplacez le texte correspondant à un modèle regex.
- Extraction : Extraire une sous-chaîne correspondant à un groupe regex.
- Analyser la date : Analysez une chaîne en une date ou un timestamp.
Pour supprimer une action, maintenez le pointeur au-dessus de sa ligne et cliquez sur .
Colonnes personnalisées
L'action Formule ouvre l'éditeur d'expressions, où vous pouvez créer une nouvelle colonne ou écraser une colonne existante en utilisant le langage naturel ou le code SQL. L'éditeur a deux zones de saisie et est bidirectionnel :
- Description : tapez une description en langage naturel de ce que vous voulez que la colonne fasse. Designer utilise Genie pour générer l'expression de code correspondante ci-dessous.
- Expression : si vous préférez écrire ou modifier du code directement, cliquez sur le bouton de modification de l'expression. La modification de l’expression génère automatiquement une description en langage naturel.
Python
Exécute un Python (PySpark) personnalisé sur les données d'entrée. Votre code reçoit des jeux de données en amont en tant que Spark DataFrames et doit attribuer un seul DataFrame à result , qui devient la sortie de cet opérateur. Utilisez le volet de configuration pour câbler les entrées et examiner toutes les options fournies par l'éditeur.
inputs["data"] est une liste de DataFrames d'entrée, dans l'ordre amont. Le volet des détails de l'opérateur affiche les noms de chaque entrée, dans l'ordre. Par exemple : Available inputs: inputs["data"][0] (customers), inputs["data"][1] (sales).
Un modèle minimal consiste à utiliser la première entrée si elle est présente, ou un DataFrame vide sinon :
# inputs["data"] is a list of input DataFrames
result = inputs["data"][0] if inputs["data"] else spark.createDataFrame([], "col: string")
À partir de là, vous pouvez enchaîner les opérations de DataFrame (par exemple, select, filter, withColumn ou les jointures) sur result avant la fin de l'affectation, ou remplacer result par un nouveau DataFrame créé à partir de inputs["data"].
Pour référencer un parameter de préparation des données visuelles, appelez dbutils.widgets.get(), tel que dbutils.widgets.get("environment"). Lorsque vous ouvrez l’opérateur pour modification, Designer affiche un exemple au-dessus de l’éditeur. See parameter.
Organisation
Note
Ajoute une note sur le canevas afin que vous puissiez documenter le workflow lui-même : son objectif, ses hypothèses, ses avertissements ou le contexte de transfert pour toute personne qui ouvrira la préparation visuelle des données ultérieurement. Le contenu des notes prend en charge le Markdown, vous pouvez donc utiliser des titres, des listes, des Link et une mise en évidence lorsque le texte brut ne suffit pas. Les notes n'affectent pas la façon dont les données circulent via les opérateurs.
Groupe
Regroupe visuellement les opérateurs sur le canevas sans modifier la façon dont les données circulent entre eux, ce qui est utile lorsqu'une préparation visuelle des données devient volumineuse ou que vous souhaitez refléter des étapes logiques.
Pour créer un groupe :
- Faites glisser des opérateurs dans un groupe : faites glisser un ou plusieurs opérateurs sur un groupe pour les y ajouter.
- Créer un groupe à partir d’une sélection : sélectionnez un ou plusieurs opérateurs, ouvrez le menu contextuel (clic droit), et choisissez Créer un nouveau groupe pour envelopper la sélection dans un nouveau groupe.
Une fois les opérateurs dans un groupe, vous pouvez donner au groupe un nom descriptif et le **réduire** ou l'**agrandir** pour afficher ou masquer son contenu sur la zone de travail.