Aller au contenu principal

Opérateurs intégrés dans Lakeflow Designer

Lakeflow Designer comprend des opérateurs intégrés pour les tâches courantes de préparation et de transformations de données. Ouvrez le menu de l'opérateur dans le panneau latéral gauche pour parcourir les opérateurs par catégorie, ou utilisez Rechercher un opérateur… en haut du panneau. La recherche d'opérateur suggère des opérateurs en fonction de votre intention. Par exemple, la saisie de average by month renvoie l'opérateur Agrégat . Pour configurer un opérateur après l'avoir ajouté au canevas, double-cliquez dessus, ou survolez-le et cliquez sur Icône de crayon. ( Modifier l'opérateur ), pour ouvrir le panneau de configuration.

Menu opérateur LFD affichant la zone de recherche d'opérateur et les opérateurs regroupés par catégorie.

Chaque opérateur affiche une description générée par l'IA de ce qu'il fait. La description agit également comme un éditeur pour l'opérateur : la modification de la description reconfigure l'opérateur afin qu'il corresponde à votre description.

Pour découvrir comment créer vos propres opérateurs définis par l’utilisateur, consultez Opérateurs définis par l’utilisateur dans Lakeflow Designer.

Source et sortie

Source

Importe les données dans Designer depuis une table Unity Catalog ou une autre source prise en charge. Pour sélectionner une source, recherchez une table ou un fichier par nom, ou naviguez par catalogue et schéma. Vous pouvez également créer une nouvelle table à partir de ce volet.

Après avoir sélectionné une table, le volet affiche le nom de la table, son propriétaire et l'heure de la dernière mise à jour. Cliquez sur Sélectionner une nouvelle source de données pour changer la source. La modification de la source invalide le cache de sortie pour tous les opérateurs en aval.

Vous pouvez également utiliser une vue métrique Unity Catalog comme source. Lorsque vous sélectionnez une vue métrique, sélectionnez les dimensions et les mesures à inclure, et Designer génère la query agrégée pour vous.

Pour toutes les options d'ingestion de données, y compris le ciblage d'un volume ou d'un dossier Unity Catalog entier, consultez Ingérer des données dans Lakeflow Designer.

Saisie des données

Crée une table en saisissant des valeurs dans un éditeur de type feuille de calcul. Utilisez cet opérateur pour ajouter de petites quantités de données de référence, telles que des valeurs de recherche ou des données de test, sans créer de table source distincte.

Champ

Description

Données de la table

Saisissez vos données sous forme de tableau. La première ligne définit les en-têtes de colonne, et les lignes restantes constituent les données. Designer infère le type de données de chaque colonne à partir de ses valeurs.

Champ

Description

Données de la table

Saisissez vos données sous forme de tableau. La première ligne définit les en-têtes de colonne, et les lignes restantes constituent les données. Designer infère le type de données de chaque colonne à partir de ses valeurs.

Résultat

Exporte les données de Designer. L'opérateur de sortie peut écrire les résultats dans une table Unity Catalog, les publier en tant que vue matérialisée, ou les écrire dans un fichier d'un volume Unity Catalog. Sélectionnez la destination avec le Type de sortie .

Type de sortie

Description

Table

Écrit les résultats dans une table gérée Unity Catalog. Définissez un **nom de table** et un **emplacement de sortie** (catalogue et schéma), puis sélectionnez un **mode d'écriture**.

Vue matérialisée

Publie les résultats sous forme de vue matérialisée dans Unity Catalog qui refresh lorsque la préparation visuelle des données s'exécute.

Fichier

Écrit les résultats dans un fichier dans un volume Unity Catalog. Sélectionnez un **type de fichier** de CSV, Excel ou JSON, puis définissez le volume cible et le nom du fichier.

Type de sortie

Description

Table

Écrit les résultats dans une table gérée Unity Catalog. Définissez un **nom de table** et un **emplacement de sortie** (catalogue et schéma), puis sélectionnez un **mode d'écriture**.

Vue matérialisée

Publie les résultats sous forme de vue matérialisée dans Unity Catalog qui refresh lorsque la préparation visuelle des données s'exécute.

Fichier

Écrit les résultats dans un fichier dans un volume Unity Catalog. Sélectionnez un **type de fichier** de CSV, Excel ou JSON, puis définissez le volume cible et le nom du fichier.

Pour une sortie **Table** ou **Fichier**, sélectionnez la manière dont chaque exécution écrit vers la destination avec le **Mode d'écriture** :

Mode d'écriture

Description

Remplacer

Remplace le contenu existant par les résultats de l'exécution actuelle. C'est le default.

Ajouter

Ajoute les résultats de l'exécution actuelle aux lignes existantes.

Merge

Insère ou met à jour des lignes dans la table cible en faisant correspondre les clés de Merge que vous spécifiez. Disponible pour les sorties de table.

Mode d'écriture

Description

Remplacer

Remplace le contenu existant par les résultats de l'exécution actuelle. C'est le default.

Ajouter

Ajoute les résultats de l'exécution actuelle aux lignes existantes.

Merge

Insère ou met à jour des lignes dans la table cible en faisant correspondre les clés de Merge que vous spécifiez. Disponible pour les sorties de table.

Cliquez sur Exécuter pour exécuter la préparation des données visuelles et écrire les résultats. Pour une sortie de table, si la table n'existe pas, l'opérateur la crée. Les exécutions planifiées écrivent vers la destination en utilisant le même mode d'écriture.

Fonction IA

Exécute une opération d'IA intégrée sur vos données. Dans le volet de configuration, ouvrez Sélectionner une fonction et sélectionnez l'une des fonctions dans le tableau suivant. Chaque fonction présente des options dans le volet pour les entrées (par exemple : colonnes, invites, étiquettes ou langues) et les sorties.

Fonction

Description

ai_analyze_sentiment

Effectue une analyse des sentiments sur le texte saisi.

ai_classify

Classe les textes ou les documents analysés à l'aide des étiquettes que vous fournissez.

ai_extract

Extrait des données structurées à partir de texte ou de documents analysés à l'aide de champs que vous définissez.

ai_fix_grammar

Corriger les erreurs grammaticales dans le texte.

ai_forecast

Prévoit les données de séries chronologiques jusqu'à un horizon que vous spécifiez. ai_forecast est une fonction à valeur de table qui traite l'intégralité de la table d'entrée.

ai_gen

Répond à une invite fournie par l'utilisateur par rapport à l'entrée.

ai_mask

Masque les entités spécifiées dans le texte (par exemple, pour la désidentification).

ai_parse_document

Extrait le texte, les tableaux et la Layout de documents non structurés.

ai_prep_search

Transforme la sortie des documents analysés en blocs prêts à être recherchés pour la recherche vectorielle et les pipelines de génération augmentée de récupération (RAG).

ai_query

Répond à une invite à l'aide de n'importe quel modèle de fondation pris en charge, pour les tâches à usage général et la flexibilité des modèles.

ai_similarity

Compare deux chaînes de caractères et renvoie un score de similarité sémantique.

ai_summarize

Génère un résumé de texte.

ai_translate

Traduit le texte dans une langue cible que vous spécifiez.

Fonction

Description

ai_analyze_sentiment

Effectue une analyse des sentiments sur le texte saisi.

ai_classify

Classe les textes ou les documents analysés à l'aide des étiquettes que vous fournissez.

ai_extract

Extrait des données structurées à partir de texte ou de documents analysés à l'aide de champs que vous définissez.

ai_fix_grammar

Corriger les erreurs grammaticales dans le texte.

ai_forecast

Prévoit les données de séries chronologiques jusqu'à un horizon que vous spécifiez. ai_forecast est une fonction à valeur de table qui traite l'intégralité de la table d'entrée.

ai_gen

Répond à une invite fournie par l'utilisateur par rapport à l'entrée.

ai_mask

Masque les entités spécifiées dans le texte (par exemple, pour la désidentification).

ai_parse_document

Extrait le texte, les tableaux et la Layout de documents non structurés.

ai_prep_search

Transforme la sortie des documents analysés en blocs prêts à être recherchés pour la recherche vectorielle et les pipelines de génération augmentée de récupération (RAG).

ai_query

Répond à une invite à l'aide de n'importe quel modèle de fondation pris en charge, pour les tâches à usage général et la flexibilité des modèles.

ai_similarity

Compare deux chaînes de caractères et renvoie un score de similarité sémantique.

ai_summarize

Génère un résumé de texte.

ai_translate

Traduit le texte dans une langue cible que vous spécifiez.

Pour plus de détails sur chaque fonction, consultez Enrichir des données à l’aide des AI Functions.

Transformations

Les opérateurs suivants effectuent des transformations sur vos données.

Agréger

Récapitule les lignes en regroupant les données et en calculant les valeurs agrégées.

Champ

Description

Agréger par

Sélectionnez une colonne, sélectionnez une fonction d'agrégation et indiquez un nom pour la colonne de sortie. Cliquez sur + Ajouter une agrégation pour en ajouter d’autres. Fonctions prises en charge : AVG, COUNT, MAX, MEAN, MEDIAN, MIN, PERCENTILE, STDDEV, SUM, VARIANCE.

Regrouper par

Sélectionnez les colonnes à regrouper par. Cliquez sur + Ajouter un regroupement pour en ajouter davantage. Les colonnes utilisées dans Regrouper par sont automatiquement incluses dans la sortie.

Champ

Description

Agréger par

Sélectionnez une colonne, sélectionnez une fonction d'agrégation et indiquez un nom pour la colonne de sortie. Cliquez sur + Ajouter une agrégation pour en ajouter d’autres. Fonctions prises en charge : AVG, COUNT, MAX, MEAN, MEDIAN, MIN, PERCENTILE, STDDEV, SUM, VARIANCE.

Regrouper par

Sélectionnez les colonnes à regrouper par. Cliquez sur + Ajouter un regroupement pour en ajouter davantage. Les colonnes utilisées dans Regrouper par sont automatiquement incluses dans la sortie.

Combiner

Merge les données de plusieurs tables avec des schémas correspondants en une seule sortie.

Champ

Description

Opération d'ensemble

Sélectionnez Union , Intersection ou À l'exception de .

Merge strategy

Sélectionnez **Distinct** pour exclure les lignes dupliquées de la sortie, ou **All** pour conserver toutes les lignes, y compris les doublons.

Champ

Description

Opération d'ensemble

Sélectionnez Union , Intersection ou À l'exception de .

Merge strategy

Sélectionnez **Distinct** pour exclure les lignes dupliquées de la sortie, ou **All** pour conserver toutes les lignes, y compris les doublons.

Filtrer

Divise les lignes selon qu'elles remplissent une ou plusieurs conditions, à l'aide d'un générateur de conditions graphique.

Champ

Description

État

Pour chaque condition, sélectionnez une colonne , un type de condition et une valeur à faire correspondre de manière conditionnelle. Types de conditions pris en charge :

  • Est égal à / N'est pas égal à
  • Fait partie de / Ne fait pas partie de
  • Contient / Ne contient pas
  • Starts with / Does not start with
  • Se termine par / Ne se termine pas par
  • Supérieur à / Inférieur à
  • Est nul / N'est pas nul

Pour les conditions sur les colonnes de date, le sélecteur de dates permet de naviguer entre les années et les mois.

Champ

Description

État

Pour chaque condition, sélectionnez une colonne , un type de condition et une valeur à faire correspondre de manière conditionnelle. Types de conditions pris en charge :

  • Est égal à / N'est pas égal à
  • Fait partie de / Ne fait pas partie de
  • Contient / Ne contient pas
  • Starts with / Does not start with
  • Se termine par / Ne se termine pas par
  • Supérieur à / Inférieur à
  • Est nul / N'est pas nul

Pour les conditions sur les colonnes de date, le sélecteur de dates permet de naviguer entre les années et les mois.

L'opérateur de filtre a deux sorties afin que vous puissiez Branch les données selon qu'elles remplissent les conditions :

Résultat

Description

Inclus

Lignes qui satisfont aux conditions de filtre.

Exclus

Les lignes qui ne répondent pas aux conditions de filtre, y compris les lignes où la condition est évaluée à null.

Résultat

Description

Inclus

Lignes qui satisfont aux conditions de filtre.

Exclus

Les lignes qui ne répondent pas aux conditions de filtre, y compris les lignes où la condition est évaluée à null.

Jointure

Link deux tables sur une clé en combinant deux datasets d'entrée basés sur des valeurs de colonne correspondantes.

Champ

Description

Tables d’entrée

Sélectionnez les deux tables d'entrée à joindre.

Condition de jointure

Spécifiez au moins une condition de jointure en sélectionnant les colonnes correspondantes des deux tables. Cliquez sur + Ajouter une expression de jointure pour ajouter d'autres conditions. Facultatif : cliquez sur la flèche entre les tables de gauche et de droite pour ajouter une condition de jointure personnalisée, puis modifiez la description générée par l'IA ou écrivez du SQL.

Respecter la casse

Lorsque désactivé (default), les clés de jointure de chaîne ne respectent pas la casse (et ignorent les espaces blancs de début et de fin). Activez l'option **Respecter la casse** pour que les clés de chaîne correspondent exactement. Cette option s'applique aux clés de jointure, non aux conditions de jointure personnalisées.

Type de jointure

Sélectionnez le type de jointure. By default, l'opérateur de jointure répartit ses résultats sur trois sorties (voir la section suivante). Sélectionnez Jointure complète , Jointure interne , Jointure gauche , ou Jointure droite pour produire une seule sortie jointe à la place.

Colonnes de sortie

Facultatif : sélectionnez les colonnes à inclure. Par default, toutes les colonnes des deux tables sont incluses. Les noms de colonne en double reçoivent un préfixe de nom de table.

Colonnes d'expression personnalisée

Facultatif : ajoutez des colonnes d'expression personnalisées basées sur le résultat joint.

Champ

Description

Tables d’entrée

Sélectionnez les deux tables d'entrée à joindre.

Condition de jointure

Spécifiez au moins une condition de jointure en sélectionnant les colonnes correspondantes des deux tables. Cliquez sur + Ajouter une expression de jointure pour ajouter d'autres conditions. Facultatif : cliquez sur la flèche entre les tables de gauche et de droite pour ajouter une condition de jointure personnalisée, puis modifiez la description générée par l'IA ou écrivez du SQL.

Respecter la casse

Lorsque désactivé (default), les clés de jointure de chaîne ne respectent pas la casse (et ignorent les espaces blancs de début et de fin). Activez l'option **Respecter la casse** pour que les clés de chaîne correspondent exactement. Cette option s'applique aux clés de jointure, non aux conditions de jointure personnalisées.

Type de jointure

Sélectionnez le type de jointure. By default, l'opérateur de jointure répartit ses résultats sur trois sorties (voir la section suivante). Sélectionnez Jointure complète , Jointure interne , Jointure gauche , ou Jointure droite pour produire une seule sortie jointe à la place.

Colonnes de sortie

Facultatif : sélectionnez les colonnes à inclure. Par default, toutes les colonnes des deux tables sont incluses. Les noms de colonne en double reçoivent un préfixe de nom de table.

Colonnes d'expression personnalisée

Facultatif : ajoutez des colonnes d'expression personnalisées basées sur le résultat joint.

Par default, l'opérateur Join dispose de trois sorties, ce qui vous permet de Branch un workflow basé sur les résultats de la jointure :

Résultat

Description

Non apparié à gauche

Lignes de l'entrée gauche qui n'ont pas de correspondance dans l'entrée droite.

Correspondant

Lignes qui correspondent aux deux entrées.

Droit non apparié

Lignes de l'entrée de droite qui n'ont pas de correspondance dans l'entrée de gauche.

Résultat

Description

Non apparié à gauche

Lignes de l'entrée gauche qui n'ont pas de correspondance dans l'entrée droite.

Correspondant

Lignes qui correspondent aux deux entrées.

Droit non apparié

Lignes de l'entrée de droite qui n'ont pas de correspondance dans l'entrée de gauche.

Lorsque vous sélectionnez un **type de jointure** spécifique (complet, interne, gauche ou droite), l'opérateur produit une sortie jointe unique au lieu des trois sorties scindées.

Limite

Limite le nombre de lignes en ne transmettant que jusqu'au nombre maximal de lignes que vous spécifiez.

Champ

Description

Nombre maximal de lignes

Spécifiez le nombre maximal de lignes à faire transiter.

Champ

Description

Nombre maximal de lignes

Spécifiez le nombre maximal de lignes à faire transiter.

Tableau croisé dynamique

Remodèle les données tabulaires dans deux directions. Utilisez les tabs en haut du volet de configuration pour sélectionner le mode.

Lignes → Colonnes (pivoter)

Transforme les valeurs distinctes d'une colonne en de nouveaux en-têtes de colonne, remplis de valeurs agrégées provenant d'une autre colonne.

Champ

Description

Colonne pivotante

Sélectionnez la colonne dont les valeurs distinctes deviennent les nouveaux en-têtes.

Valeur et agrégation

Sélectionnez la colonne dont les valeurs remplissent les cellules pivotées, et sélectionnez une fonction d'agrégation (par exemple, SUM, AVG, COUNT, MIN, ou MAX). Configurez la manière dont les valeurs manquantes sont gérées (par exemple, nulles ou zéro), si disponible dans le volet.

Champ

Description

Colonne pivotante

Sélectionnez la colonne dont les valeurs distinctes deviennent les nouveaux en-têtes.

Valeur et agrégation

Sélectionnez la colonne dont les valeurs remplissent les cellules pivotées, et sélectionnez une fonction d'agrégation (par exemple, SUM, AVG, COUNT, MIN, ou MAX). Configurez la manière dont les valeurs manquantes sont gérées (par exemple, nulles ou zéro), si disponible dans le volet.

Colonnes → Lignes (dépivotement)

Convertit une ou plusieurs colonnes en lignes.

Champ

Description

Annuler le pivotement des colonnes

Sélectionnez les colonnes à dépivoter.

Colonnes de clé et de valeur

Définissez les noms des colonnes de clé et de valeur de sortie.

Champ

Description

Annuler le pivotement des colonnes

Sélectionnez les colonnes à dépivoter.

Colonnes de clé et de valeur

Définissez les noms des colonnes de clé et de valeur de sortie.

Inclure les colonnes

Pour l'un ou l'autre mode, sélectionnez les colonnes qui restent dans la sortie aux côtés des valeurs pivotées ou non pivotées, et supprimez les colonnes dont vous n'avez pas besoin avant la transformation. Le concepteur déduit les colonnes fixes (de regroupement) des colonnes que vous n'attribuez pas aux rôles de pivot, de valeur ou de non-pivot.

Trier

Ordonne les lignes sur une ou plusieurs colonnes.

Champ

Description

Ordre de tri

Sélectionnez **ASC** (croissant) ou **DESC** (décroissant) pour chaque colonne. Cliquez sur **+ Ajouter une expression de tri** pour trier par des colonnes supplémentaires. Le tri suit l'ordre lexical standard.

Champ

Description

Ordre de tri

Sélectionnez **ASC** (croissant) ou **DESC** (décroissant) pour chaque colonne. Cliquez sur **+ Ajouter une expression de tri** pour trier par des colonnes supplémentaires. Le tri suit l'ordre lexical standard.

SQL

Écrit du code SQL personnalisé pour toute transformation non couverte par les autres opérateurs.

Champ

Description

Éditeur SQL

Saisissez une instruction SQL SELECT. Pour référencer la sortie d’un opérateur d’entrée, utilisez le nom de cet opérateur comme nom de table dans votre query. Par exemple :

SQL
SELECT COUNT(*)
FROM aggregate_2
WHERE 1 = 1

Cliquez sur le bouton Icône de code. pour ouvrir le volet de code SQL complet et voir comment votre instruction s'intègre dans le flux de travail complet.

Paramètres

Pour référencer un paramètre de préparation de données visuelles, utilisez la syntaxe des marqueurs de paramètres nommé, tels que :environment. Le concepteur affiche un exemple au-dessus de l'éditeur lorsque vous ouvrez l'opérateur pour modifier. See parameter.

Champ

Description

Éditeur SQL

Saisissez une instruction SQL SELECT. Pour référencer la sortie d’un opérateur d’entrée, utilisez le nom de cet opérateur comme nom de table dans votre query. Par exemple :

SQL
SELECT COUNT(*)
FROM aggregate_2
WHERE 1 = 1

Cliquez sur le bouton Icône de code. pour ouvrir le volet de code SQL complet et voir comment votre instruction s'intègre dans le flux de travail complet.

Paramètres

Pour référencer un paramètre de préparation de données visuelles, utilisez la syntaxe des marqueurs de paramètres nommé, tels que :environment. Le concepteur affiche un exemple au-dessus de l'éditeur lorsque vous ouvrez l'opérateur pour modifier. See parameter.

Sélectionner

Sélectionne, renomme et réorganise les colonnes des données d’entrée.

Champ

Description

Inclure ou exclure des colonnes

Sélectionnez Start with all columns ou Start with no columns , puis utilisez les cases à cocher pour inclure ou exclure des colonnes individuelles. Faire glisser les colonnes pour les réorganiser.

Renommer une colonne

Saisissez un nouveau nom dans le champ Renommer à côté de n’importe quelle colonne.

Champ

Description

Inclure ou exclure des colonnes

Sélectionnez Start with all columns ou Start with no columns , puis utilisez les cases à cocher pour inclure ou exclure des colonnes individuelles. Faire glisser les colonnes pour les réorganiser.

Renommer une colonne

Saisissez un nouveau nom dans le champ Renommer à côté de n’importe quelle colonne.

Préparer

Nettoie et dérive les colonnes en enchaînant une ou plusieurs actions sur les données d'entrée. Cliquez sur + Ajouter une action et sélectionnez une action. Ajoutez autant d'actions que vous le souhaitez. Elles s'appliquent dans l'ordre.

Action

Description

Formule

Créez une nouvelle colonne ou écrasez une colonne existante à l'aide du langage naturel ou d'une expression SQL.

Changer le type

Convertir une colonne vers un autre type de données.

Remplacer la valeur

Rechercher et remplacer des valeurs dans une colonne.

Remplir les valeurs nulles

Remplacez les valeurs nulles par une constante.

Casse du texte

Modifier la casse en minuscules, majuscules ou titre.

Tronquer

Supprimer les espaces à une ou aux deux extrémités.

Remplacement Regex

Remplacer le texte correspondant à un modèle regex.

Extraire

Extraire une sous-chaîne correspondant à un groupe regex.

Analyser la date

Analyser une chaîne en date ou en Timestamp.

Action

Description

Formule

Créez une nouvelle colonne ou écrasez une colonne existante à l'aide du langage naturel ou d'une expression SQL.

Changer le type

Convertir une colonne vers un autre type de données.

Remplacer la valeur

Rechercher et remplacer des valeurs dans une colonne.

Remplir les valeurs nulles

Remplacez les valeurs nulles par une constante.

Casse du texte

Modifier la casse en minuscules, majuscules ou titre.

Tronquer

Supprimer les espaces à une ou aux deux extrémités.

Remplacement Regex

Remplacer le texte correspondant à un modèle regex.

Extraire

Extraire une sous-chaîne correspondant à un groupe regex.

Analyser la date

Analyser une chaîne en date ou en Timestamp.

Pour supprimer une action, survolez sa ligne et cliquez sur Icône de tiret..

Colonnes personnalisées

L'action Formule ouvre l'éditeur d'expressions, où vous pouvez créer une nouvelle colonne ou écraser une colonne existante en utilisant le langage naturel ou le code SQL. L'éditeur a deux zones de saisie et est bidirectionnel :

  • Description : tapez une description en langage naturel de ce que vous voulez que la colonne fasse. Designer utilise Genie pour générer l'expression de code correspondante ci-dessous.
  • Expression : si vous préférez écrire ou modifier du code directement, cliquez sur le bouton de modification de l'expression. La modification de l’expression génère automatiquement une description en langage naturel.

Python

Exécute du code Python personnalisé (PySpark) sur les données d'entrée.

Champ

Description

result

Attribuez un seul DataFrame à result, qui devient la sortie de l'opérateur.

inputs["data"]

Une liste de DataFrames d'entrée, en ordre amont. Le volet des détails de l'opérateur affiche le nom de chaque entrée, dans l'ordre. Par exemple, Available inputs: inputs["data"][0] (customers), inputs["data"][1] (sales).

Paramètres

Appelez dbutils.widgets.get(), tel que dbutils.widgets.get("environment"), pour faire référence à un paramètre de préparation visuelle des données. Le concepteur affiche un exemple au-dessus de l'éditeur lorsque vous ouvrez l'opérateur pour modifier. See parameter.

Champ

Description

result

Attribuez un seul DataFrame à result, qui devient la sortie de l'opérateur.

inputs["data"]

Une liste de DataFrames d'entrée, en ordre amont. Le volet des détails de l'opérateur affiche le nom de chaque entrée, dans l'ordre. Par exemple, Available inputs: inputs["data"][0] (customers), inputs["data"][1] (sales).

Paramètres

Appelez dbutils.widgets.get(), tel que dbutils.widgets.get("environment"), pour faire référence à un paramètre de préparation visuelle des données. Le concepteur affiche un exemple au-dessus de l'éditeur lorsque vous ouvrez l'opérateur pour modifier. See parameter.

Un modèle minimal consiste à utiliser la première entrée si elle est présente, ou un DataFrame vide sinon :

Python
# inputs["data"] is a list of input DataFrames

result = inputs["data"][0] if inputs["data"] else spark.createDataFrame([], "col: string")

À partir de là, vous pouvez enchaîner les opérations de DataFrame (par exemple, select, filter, withColumn ou les jointures) sur result avant la fin de l'affectation, ou remplacer result par un nouveau DataFrame créé à partir de inputs["data"].

Organisation

Note

Ajoute une note sur le canevas afin que vous puissiez documenter le workflow lui-même : son objectif, ses hypothèses, ses mises en garde ou le contexte de transfert pour toute personne qui ouvrira la préparation visuelle des données plus tard.

Champ

Description

Contenu

Modifiez le contenu des notes directement sur le canevas avec un éditeur de texte enrichi. Vous pouvez ajouter des titres, la mise en forme du texte, des Link, des images et des tableaux là où le texte brut n'est pas suffisant. Les notes n'affectent pas la façon dont les données circulent par les opérateurs.

Champ

Description

Contenu

Modifiez le contenu des notes directement sur le canevas avec un éditeur de texte enrichi. Vous pouvez ajouter des titres, la mise en forme du texte, des Link, des images et des tableaux là où le texte brut n'est pas suffisant. Les notes n'affectent pas la façon dont les données circulent par les opérateurs.

Groupe

Regroupe visuellement les opérateurs sur le canevas sans modifier la façon dont les données circulent entre eux, ce qui est utile lorsqu'une préparation visuelle des données devient volumineuse ou que vous souhaitez refléter des étapes logiques.

Champ

Description

Ajouter au groupe

Faites glisser un ou plusieurs opérateurs sur un groupe pour les y ajouter.

Créer à partir de la sélection

Sélectionnez un ou plusieurs opérateurs, ouvrez le menu contextuel (clic droit), et sélectionnez Créer un nouveau groupe pour envelopper la sélection dans un nouveau groupe.

Nom

Donnez un nom descriptif au groupe.

Réduire / agrandir

Cliquez sur **réduire** ou **agrandir** pour afficher ou masquer le contenu du groupe sur la toile.

Champ

Description

Ajouter au groupe

Faites glisser un ou plusieurs opérateurs sur un groupe pour les y ajouter.

Créer à partir de la sélection

Sélectionnez un ou plusieurs opérateurs, ouvrez le menu contextuel (clic droit), et sélectionnez Créer un nouveau groupe pour envelopper la sélection dans un nouveau groupe.

Nom

Donnez un nom descriptif au groupe.

Réduire / agrandir

Cliquez sur **réduire** ou **agrandir** pour afficher ou masquer le contenu du groupe sur la toile.

Visualisation

Crée une visualisation à partir des données d'entrée et l'affiche directement sur la zone de travail. Connectez un opérateur de visualisation à tout opérateur produisant des données tabulaires pour visualiser les résultats sans quitter Designer.

Pour configurer la visualisation, ouvrez l'opérateur et sélectionnez un type de Visualisation , puis mappez vos colonnes au graphique.

Champ

Description

Visualisation

Le type de graphique à rendre, tel que **barres**, **aires**, ou **compteur**.

Champ

Description

Visualisation

Le type de graphique à rendre, tel que **barres**, **aires**, ou **compteur**.

Ressources supplémentaires