bamboolib
Cette documentation a été retirée et pourrait ne pas être mise à jour. bamboolib est obsolète. Pour obtenir de l'aide sur la génération de code, consultez Databricks Assistant.
bamboolib est pris en charge dans Databricks Runtime 11.3 LTS et versions ultérieures.
bamboolib est un composant d'interface utilisateur qui permet l'analyse et les transformations de données sans code depuis un notebook Databricks. bamboolib aide les utilisateurs à travailler plus facilement avec leurs données et accélère les tâches courantes de préparation, d'exploration et de visualisation des données. Lorsque les utilisateurs effectuent ce type de tâches avec leurs données, bamboolib génère automatiquement le code Python en arrière-plan. Les utilisateurs peuvent partager ce code avec d’autres personnes, qui peuvent l’exécuter dans leurs propres notebooks pour reproduire rapidement ces tâches d’origine. Ils peuvent également utiliser bamboolib pour étendre ces tâches originales avec des tâches de données supplémentaires, le tout sans avoir besoin de savoir coder. Ceux qui ont de l'expérience en codage peuvent étendre ce code pour créer des résultats encore plus sophistiqués.
En arrière-plan, bamboolib utilise ipywidgets, qui est un framework de widgets HTML interactifs pour le noyau IPython dans les Notebooks Databricks. ipywidgets s'exécute à l'intérieur du noyau IPython dans les Notebooks Databricks.
Contenus
Exigences
- Un notebook Databricks, qui est attaché à un cluster Databricks avec Databricks Runtime 11,0 ou version supérieure.
- La bibliothèque
bamboolibdoit être disponible pour le Notebook.- Pour installer la bibliothèque depuis PyPI uniquement sur un cluster spécifique, veuillez consulter les bibliothèques à l'échelle du compute.
- Pour utiliser la commande
%pipafin de rendre la bibliothèque disponible uniquement pour un Notebook spécifique, consultez bibliothèques Python à l’échelle du Notebook.
Démarrage rapide
-
Créer un Notebook Python.
-
Dans la première cellule du Notebook, saisissez le code suivant, puis exécutez la cellule. Ignorez cette étape si bamboolib est déjà installé dans le Workspace ou le cluster.
Python%pip install bamboolib -
Dans la deuxième cellule du notebook, entrez le code suivant, puis exécutez la cellule.
Pythonimport bamboolib as bam -
Dans la 3e cellule du Notebook, entrez le code suivant, puis exécutez la cellule.
Pythonbam
Alternativement, vous pouvez imprimer un DataFrame pandas existant pour afficher bamboolib afin de l'utiliser avec ce DataFrame spécifique.
- Continuez avec les tâches clés.
Guides pas à pas
Vous pouvez utiliser bamboolib seul ou avec un DataFrame pandas existant.
Utilisez bamboolib par lui-même
Dans ce tutoriel, vous utilisez bamboolib pour afficher le contenu d’un exemple de jeu de données de ventes dans votre notebook. Vous expérimentez ensuite avec du code de notebook associé que bamboolib génère automatiquement pour vous. Vous terminez par l'interrogation et le tri d'une copie du contenu du dataset Ventes.
-
Créer un Notebook Python.
-
Dans la première cellule du Notebook, saisissez le code suivant, puis exécutez la cellule. Ignorez cette étape si bamboolib est déjà installé dans le Workspace ou le cluster.
Python%pip install bamboolib -
Dans la deuxième cellule du notebook, entrez le code suivant, puis exécutez la cellule.
Pythonimport bamboolib as bam -
Dans la 3e cellule du Notebook, entrez le code suivant, puis exécutez la cellule.
Pythonbam -
Cliquer sur **Charger des données factices**.
-
Dans le volet **Charger des données de test**, pour **Charger un dataset de test pour bamboolib**, sélectionnez **Ventes dataset**.
-
Cliquez sur Exécuter .
-
Affichez toutes les lignes où **item_type** est **Baby Food** :
- Dans la liste **Actions de recherche**, sélectionnez **Filtrer les lignes**.
- Dans le volet **Filtrer les lignes**, dans la liste **Choisir** (au-dessus de **où**), sélectionnez **Sélectionner les lignes**.
- Dans la liste ci-dessous **where**,sélectionnez **item_type**.
- Dans la liste Choisir , à côté de item_type , sélectionnez a une ou plusieurs valeur(s) .
- Dans la case Choisir la/les valeur(s) à côté de a des valeurs , sélectionnez Baby Food .
- Cliquez sur Exécuter .
-
Copiez le code Python généré automatiquement pour cette query :
- Cliquez sur Copier le code sous l'aperçu des données.
-
Collez et modifiez le code :
- Dans la quatrième cellule du Notebook, collez le code que vous avez copié. Cela devrait ressembler à ceci :
Pythonimport pandas as pd
df = pd.read_csv(bam.sales_csv)
# Step: Keep rows where item_type is one of: Baby Food
df = df.loc[df['item_type'].isin(['Baby Food'])]- Ajoutez à ce code pour qu'il affiche uniquement les lignes où order_prio est C , puis exécutez la cellule :
Pythonimport pandas as pd
df = pd.read_csv(bam.sales_csv)
# Step: Keep rows where item_type is one of: Baby Food
df = df.loc[df['item_type'].isin(['Baby Food'])]
# Add the following code.
# Step: Keep rows where order_prio is one of: C
df = df.loc[df['order_prio'].isin(['C'])]
df
Au lieu d'écrire ce code, vous pouvez également faire la même chose en utilisant simplement bamboolib dans la troisième cellule pour afficher uniquement les lignes où **order_prio** est **C**. Cette étape est un exemple d'extension du code que bamboolib a généré automatiquement précédemment.
-
Trier les lignes par **région** par ordre croissant :
- Dans le widget de la quatrième cellule, dans la liste Actions de recherche , sélectionnez Trier les lignes .
- Dans le volet Trier la ou les colonnes , dans la liste Choisir la colonne , sélectionnez région .
- Dans la liste à côté de région , sélectionnez croissant (A-Z) .
- Cliquez sur Exécuter .
Ceci équivaut à écrire le code suivant vous-même :
df = df.sort_values(by=['region'], ascending=[True])
df
Vous auriez également pu utiliser bamboolib dans la troisième cellule pour trier les lignes par région par ordre croissant. Cette étape montre comment vous pouvez utiliser bamboolib pour étendre le code que vous écrivez. Lorsque vous utilisez bamboolib, il génère automatiquement le code supplémentaire pour vous en arrière-plan, afin que vous puissiez étendre davantage votre code déjà étendu !
- Continuez avec les tâches clés.
Utiliser bamboolib avec un DataFrame existant
Dans cette présentation guidée, vous utilisez bamboolib pour afficher dans votre notebook le contenu d'un pandas DataFrame. Ce DataFrame contient une copie d'un exemple de jeu de données de ventes. Vous expérimentez ensuite avec une partie du code de notebook associé que bamboolib génère automatiquement pour vous. Vous terminez par interroger et trier une partie du contenu du DataFrame.
-
Créer un Notebook Python.
-
Dans la première cellule du Notebook, saisissez le code suivant, puis exécutez la cellule. Ignorez cette étape si bamboolib est déjà installé dans le Workspace ou le cluster.
Python%pip install bamboolib -
Dans la deuxième cellule du notebook, entrez le code suivant, puis exécutez la cellule.
Pythonimport bamboolib as bam -
Dans la 3e cellule du Notebook, entrez le code suivant, puis exécutez la cellule.
Pythonimport pandas as pd
df = pd.read_csv(bam.sales_csv)
dfNotez que bamboolib ne prend en charge que les DataFrames pandas. Pour convertir un DataFrame PySpark en DataFrame pandas, appelez toPandas sur le DataFrame PySpark. Pour convertir un DataFrame Pandas API sur Spark en DataFrame pandas, appelez to_pandas sur le DataFrame Pandas API sur Spark.
-
Cliquez sur Afficher l'interface utilisateur bamboolib .
-
Affichez toutes les lignes où **item_type** est **Baby Food** :
- Dans la liste **Actions de recherche**, sélectionnez **Filtrer les lignes**.
- Dans le volet **Filtrer les lignes**, dans la liste **Choisir** (au-dessus de **où**), sélectionnez **Sélectionner les lignes**.
- Dans la liste ci-dessous **where**,sélectionnez **item_type**.
- Dans la liste Choisir , à côté de item_type , sélectionnez a une ou plusieurs valeur(s) .
- Dans la case Choisir la/les valeur(s) à côté de a des valeurs , sélectionnez Baby Food .
- Cliquez sur Exécuter .
-
Copiez le code Python généré automatiquement pour cette query. Pour ce faire, cliquez sur Copier le code sous l'aperçu des données.
-
Collez et modifiez le code :
-
Dans la quatrième cellule du Notebook, collez le code que vous avez copié. Cela devrait ressembler à ceci :
Python# Step: Keep rows where item_type is one of: Baby Food
df = df.loc[df['item_type'].isin(['Baby Food'])] -
Ajoutez à ce code pour qu'il affiche uniquement les lignes où order_prio est C , puis exécutez la cellule :
Python# Step: Keep rows where item_type is one of: Baby Food
df = df.loc[df['item_type'].isin(['Baby Food'])]
# Add the following code.
# Step: Keep rows where order_prio is one of: C
df = df.loc[df['order_prio'].isin(['C'])]
df
-
Au lieu d'écrire ce code, vous pouvez également faire la même chose en utilisant simplement bamboolib dans la troisième cellule pour afficher uniquement les lignes où **order_prio** est **C**. Cette étape est un exemple d'extension du code que bamboolib a généré automatiquement précédemment.
-
Trier les lignes par **région** par ordre croissant :
a. Dans le widget de la quatrième cellule, cliquez sur Trier les lignes .
- Dans le volet Trier la ou les colonnes , dans la liste Choisir la colonne , sélectionnez région .
- Dans la liste à côté de région , sélectionnez croissant (A-Z) .
- Cliquez sur Exécuter .
Ceci équivaut à écrire le code suivant vous-même :
df = df.sort_values(by=['region'], ascending=[True])
df
Vous auriez également pu utiliser bamboolib dans la troisième cellule pour trier les lignes par région par ordre croissant. Cette étape montre comment vous pouvez utiliser bamboolib pour étendre le code que vous écrivez. Lorsque vous utilisez bamboolib, il génère automatiquement le code supplémentaire pour vous en arrière-plan, afin que vous puissiez étendre davantage votre code déjà étendu !
- Continuez avec les tâches clés.
Tâches clés
Dans cette section :
- Ajoutez le widget à une cellule
- Effacer le widget
- Tâches de chargement de données
- Tâches d'actions sur les données
- Tâches d'historique des actions de données
- Obtenez le code pour recréer par programmation l'état actuel du widget en tant que DataFrame
Ajoutez le widget à une cellule
Scénario : Vous souhaitez que le widget bamboolib s'affiche dans une cellule.
-
Assurez-vous que le Notebook répond aux exigences pour bamboolib.
-
Si bamboolib n'est pas déjà installé dans le workspace ou le cluster, exécutez le code suivant dans une cellule du Notebook, de préférence dans la première cellule :
Python%pip install bamboolib -
Exécutez le code suivant dans le Notebook, de préférence dans la première ou la deuxième cellule du Notebook :
Pythonimport bamboolib as bam -
Option 1 : Dans la cellule où vous souhaitez que le widget apparaisse, ajoutez le code suivant, puis exécutez la cellule :
PythonbamLe widget apparaît dans la cellule sous le code.
Ou :
Option 2 : Dans une cellule qui contient une référence à un pandas DataFrame, imprimez le DataFrame. Par exemple, étant donné la définition de DataFrame suivante, exécutez la cellule :
Pythonimport pandas as pd
from datetime import datetime, date
df = pd.DataFrame({
'a': [ 1, 2, 3 ],
'b': [ 2., 3., 4. ],
'c': [ 'string1', 'string2', 'string3' ],
'd': [ date(2000, 1, 1), date(2000, 2, 1), date(2000, 3, 1) ],
'e': [ datetime(2000, 1, 1, 12, 0), datetime(2000, 1, 2, 12, 0), datetime(2000, 1, 3, 12, 0) ]
})
dfLe widget apparaît dans la cellule sous le code.
Notez que bamboolib ne prend en charge que les DataFrames pandas. Pour convertir un DataFrame PySpark en DataFrame pandas, appelez toPandas sur le DataFrame PySpark. Pour convertir un DataFrame Pandas API sur Spark en DataFrame pandas, appelez to_pandas sur le DataFrame Pandas API sur Spark.
Effacer le widget
Scénario : Vous souhaitez effacer le contenu d’un widget, puis lire de nouvelles données dans le widget existant.
Option 1 : Exécutez le code suivant dans la cellule qui contient le widget cible :
bam
Le widget efface, puis réaffiche les boutons suivants : Databricks : lire un fichier CSV depuis DBFS , Databricks : charger une table de base de données , et Charger des données factices .
Si l'erreur name 'bam' is not defined apparaît, exécutez le code suivant dans le notebook (de préférence dans la première cellule du notebook), puis réessayez :
import bamboolib as bam
Option 2 : Dans une cellule qui contient une référence à un DataFrame pandas, imprimez de nouveau le DataFrame en exécutant de nouveau la cellule. Le widget se vide, puis affiche les nouvelles données.
Tâches de chargement des données
Dans cette section :
- Lire le contenu d'un dataset d'exemple dans le widget
- Lisez le contenu d'un fichier CSV dans le widget
- Lire le contenu d'une table de base de données dans le widget
Lire le contenu d'un exemple de dataset dans le widget
Scénario : Vous voulez lire des exemples de données dans le widget, par exemple des données de Ventes fictives, afin de pouvoir tester la fonctionnalité du widget.
- Cliquer sur **Charger des données factices**.
Si Charger des données factices n'est pas visible, effacez le widget avec l'option 1 et réessayez.
-
Dans le volet Charger des données factices , pour Charger un dataset factice pour tester bamboolib , sélectionnez le nom du dataset que vous souhaitez charger.
-
Pour le nom du DataFrame , saisissez un nom pour l'identifiant programmatique du contenu de la table en tant que DataFrame, ou laissez df comme identifiant programmatique par default.
-
Cliquez sur Exécuter .
Le widget affiche le contenu du dataset.
Vous pouvez faire passer le widget actuel pour afficher le contenu d'un autre exemple de dataset :
- Dans le widget actuel, cliquez sur le tab Charger les données factices .
- Suivez les étapes précédentes pour lire le contenu de l'autre exemple de dataset dans le widget.
Lisez le contenu d'un fichier CSV dans le widget
Scénario : Vous voulez lire le contenu d’un fichier CSV dans votre Databricks Workspace dans le widget.
- Cliquez sur Databricks : lire un fichier CSV depuis DBFS .
Si Databricks: Read CSV file from DBFS n’est pas visible, effacez le widget avec l’option 1 et réessayez.
-
Dans le volet **Lire CSV depuis DBFS**, naviguez jusqu’à l’emplacement contenant le fichier CSV cible.
-
Sélectionnez le fichier CSV cible.
-
Pour le **nom du DataFrame**, saisissez un nom pour l'identificateur programmatique du contenu du fichier CSV en tant que DataFrame,ou laissez **df** comme identificateur programmatique par default.
-
Pour le séparateur de valeurs CSV, entrez le caractère qui sépare les valeurs dans le fichier CSV, ou laissez le caractère **,** (virgule) comme séparateur de valeurs par default.
-
Pour le séparateur décimal , saisissez le caractère qui sépare les décimales dans le fichier CSV, ou laissez le . Caractère (point) comme séparateur de valeur default.
-
Pour **Limite de lignes : lire les N premières lignes - laisser vide pour aucune limite**, entrez le nombre maximal de lignes à lire dans le widget, ou laissez **100000** comme nombre de lignes par default, ou laissez cette case vide pour ne spécifier aucune limite de lignes.
-
Cliquez sur Ouvrir le fichier CSV .
Le widget affiche le contenu du fichier CSV, en fonction des paramètres que vous avez spécifiés.
Vous pouvez changer le widget actuel pour afficher le contenu d'un autre fichier CSV :
- Dans le widget actuel, cliquez sur l'onglet Read CSV from DBFS .
- Suivez les étapes précédentes pour lire le contenu de l'autre fichier CSV dans le widget.
Lire le contenu d'une table de base de données dans le widget
Scénario : Vous souhaitez lire le contenu d'une table de base de données de votre Databricks Workspace dans le widget.
- Cliquez sur **Databricks : Charger la table de la base de données**.
Si Databricks : Charger la table de base de données n'est pas visible, effacez le widget avec l'Option 1 et réessayez.
-
Dans le volet **Databricks : Load database table**, pour **Database – laisser vide pour la base de données par default**, entrez le nom de la base de données dans laquelle la table cible est située, ou laissez cette case vide pour spécifier la base de données **default**.
-
Pour Table , saisissez le nom de la table cible.
-
Pour **Limite de lignes : lire les N premières lignes - laisser vide pour aucune limite**, entrez le nombre maximal de lignes à lire dans le widget, ou laissez **100000** comme nombre de lignes par default, ou laissez cette case vide pour ne spécifier aucune limite de lignes.
-
Pour le nom du DataFrame , saisissez un nom pour l'identifiant programmatique du contenu de la table en tant que DataFrame, ou laissez df comme identifiant programmatique par default.
-
Cliquez sur Exécuter .
Le widget affiche le contenu de la table, en fonction des paramètres que vous avez spécifiés.
Vous pouvez basculer le widget actuel pour afficher le contenu d'une autre table :
- Dans le widget actuel, cliquez sur l'onglet Databricks: Load database table tab.
- Suivez les étapes précédentes pour lire le contenu de l'autre table dans le widget.
Tâches d'action de données
bamboolib offre plus de 50 actions de données. Voici quelques-unes des tâches d'action de données de getting-start les plus courantes.
Dans cette section :
- Sélectionner les colonnes
- Supprimer les colonnes
- Filtrer les lignes
- Trier les lignes
- Tâches de regroupement de lignes et de colonnes
- Supprimer les lignes dont les valeurs sont incomplètes
- Supprimer les lignes en double
- Rechercher et remplacer les valeurs manquantes
- Créer une formule de colonne
Sélectionner des colonnes
**Scénario** : Vous souhaitez afficher uniquement des colonnes de table spécifiques par nom, par type de données ou correspondant à une expression régulière. Par exemple, dans le **dataset Ventes** factice, vous ne voulez afficher item_type que sales_channel les colonnes et, ou vous voulez afficher uniquement les colonnes qui contiennent la chaîne _date dans leurs noms de colonne.
-
Dans le tab Données , dans la liste déroulante Actions de recherche, effectuez l'une des opérations suivantes :
- Tapez select , puis sélectionnez Sélectionner ou supprimer des colonnes .
- Sélectionnez Sélectionner ou supprimer des colonnes .
-
Dans le volet Sélectionner ou supprimer des colonnes , dans la liste déroulante Choisir , sélectionnez Sélectionner .
-
Sélectionnez les noms des colonnes cibles ou le critère d’inclusion.
-
Pour le nom du DataFrame , saisissez un nom pour l'identifiant programmatique du contenu de la table en tant que DataFrame, ou laissez df comme identifiant programmatique par default.
-
Cliquez sur Exécuter .
Supprimer des colonnes
Scénario : Vous souhaitez masquer certaines colonnes de table par nom, par type de données ou qui correspondent à une expression régulière. Par exemple, dans le dataset Ventes factice, vous souhaitez masquer les colonnes order_prio, order_date et ship_date, ou vous souhaitez masquer toutes les colonnes qui ne contiennent que des valeurs de date et d'heure.
-
Dans le tab Données , dans la liste déroulante Actions de recherche, effectuez l'une des opérations suivantes :
- Tapez **drop**, puis sélectionnez **Sélectionner ou supprimer des colonnes**.
- Sélectionnez Sélectionner ou supprimer des colonnes .
-
Dans le volet Sélectionner ou supprimer des colonnes , dans la liste déroulante Choisir , sélectionnez Supprimer .
-
Sélectionnez les noms des colonnes cibles ou le critère d’inclusion.
-
Pour le nom du DataFrame , saisissez un nom pour l'identifiant programmatique du contenu de la table en tant que DataFrame, ou laissez df comme identifiant programmatique par default.
-
Cliquez sur Exécuter .
Filtrer les lignes
Scénario : vous souhaitez afficher ou masquer des lignes de table spécifiques en fonction de critères tels que des valeurs de colonne spécifiques qui correspondent ou sont manquantes. Par exemple, dans le dataset Ventes factice, vous voulez afficher uniquement les lignes dont la valeur de la colonne item_type est définie sur Baby Food.
-
Dans le tab Données , dans la liste déroulante Actions de recherche, effectuez l'une des opérations suivantes :
- Tapez **filter**, puis sélectionnez **Filter rows**.
- Sélectionnez **Filtrer les lignes**.
-
Dans le volet Filtrer les lignes , dans la liste déroulante Choisir au-dessus de où , sélectionnez Sélectionner les lignes ou Supprimer les lignes .
-
Spécifiez le premier critère de filtre.
-
Pour ajouter un autre critère de filtre, cliquez sur ajouter une condition et spécifiez le critère de filtre suivant. Répétez si vous le souhaitez.
-
Pour le nom du DataFrame , saisissez un nom pour l'identifiant programmatique du contenu de la table en tant que DataFrame, ou laissez df comme identifiant programmatique par default.
-
Cliquez sur Exécuter .
Trier les lignes
**Scénario** : Vous souhaitez trier les lignes d'une table en fonction des valeurs dans une ou plusieurs colonnes. Par exemple, dans le **dataset de ventes** factice, vous souhaitez afficher les lignes selon les valeurs de la region colonne par ordre alphabétique de A à Z.
-
Dans le tab Données , dans la liste déroulante Actions de recherche, effectuez l'une des opérations suivantes :
- Tapez **trier**, puis sélectionnez **Trier les lignes**.
- Sélectionner **Trier les lignes**.
-
Dans le volet **Trier la/les colonne(s)**, choisissez la première colonne à trier et l'ordre de tri.
-
Pour ajouter un autre critère de tri, cliquez sur ajouter une colonne et spécifiez le critère de tri suivant. Répétez si vous le souhaitez.
-
Pour le nom du DataFrame , saisissez un nom pour l'identifiant programmatique du contenu de la table en tant que DataFrame, ou laissez df comme identifiant programmatique par default.
-
Cliquez sur Exécuter .
Regroupement de tâches de lignes et de colonnes
Dans cette section :
- Regrouper les lignes et les colonnes par une seule fonction d'agrégation
- Regrouper les lignes et les colonnes par plusieurs fonctions d'agrégation
Grouper les lignes et les colonnes par une seule fonction d’agrégation
**Scénario **: vous souhaitez afficher les résultats des lignes et des colonnes par regroupements calculés, et vous souhaitez attribuer des noms personnalisés à ces regroupements. Par exemple, dans le **dataset Ventes** factice, vous voulez regrouper les lignes par les country valeurs de la colonne, en affichant le nombre de lignes contenant la même country valeur, et en donnant à la liste des nombres calculés le country_count nom.
-
Dans le tab Données , dans la liste déroulante Actions de recherche, effectuez l'une des opérations suivantes :
- Saisissez group , puis sélectionnez Grouper par et agréger (avec renommage) .
- Sélectionnez Regrouper et agréger (avec renommage) .
-
Dans le volet Regrouper par avec renommage de colonne , sélectionnez les colonnes à regrouper, le premier calcul, et spécifiez éventuellement un nom pour la colonne calculée.
-
Pour ajouter un autre calcul, cliquez sur ajouter un calcul , et spécifiez le calcul suivant et le nom de la colonne. Répétez si vous le souhaitez.
-
Spécifiez où stocker le résultat.
-
Pour le nom du DataFrame , saisissez un nom pour l'identifiant programmatique du contenu de la table en tant que DataFrame, ou laissez df comme identifiant programmatique par default.
-
Cliquez sur Exécuter .
Regroupez les lignes et les colonnes par plusieurs fonctions d'agrégation
Scénario : vous souhaitez afficher les résultats des lignes et des colonnes par regroupements calculés. Par exemple, dans le dataset Ventes factice, vous souhaitez regrouper les lignes par les valeurs des colonnes region, country et sales_channel, en affichant le nombre de lignes contenant les mêmes valeurs region et country par sales_channel, ainsi que le total_revenue par combinaison unique de region, country et sales_channel.
-
Dans le tab Données , dans la liste déroulante Actions de recherche, effectuez l'une des opérations suivantes :
- Tapez **group**, puis sélectionnez **Regrouper par et agréger (default)**.
- Sélectionnez Grouper par et agréger (default) .
-
Dans le volet **Grouper par avec renommage de colonne**, sélectionnez les colonnes à regrouper et le premier calcul.
-
Pour ajouter un autre calcul, cliquez sur ajouter un calcul et spécifiez le calcul suivant. Répétez si vous le souhaitez.
-
Spécifiez où stocker le résultat.
-
Pour le nom du DataFrame , saisissez un nom pour l'identifiant programmatique du contenu de la table en tant que DataFrame, ou laissez df comme identifiant programmatique par default.
-
Cliquez sur Exécuter .
Supprimer les lignes avec des valeurs manquantes
**Scénario** : Vous voulez supprimer toutes les lignes ayant une valeur manquante pour les colonnes spécifiées. Par exemple, dans le **dataset de ventes** fictif, vous voulez supprimer toutes les lignes qui ont une item_type valeur manquante.
-
Dans le tab Données , dans la liste déroulante Actions de recherche, effectuez l'une des opérations suivantes :
- Saisissez supprimer ou retirer , puis sélectionnez Supprimer les valeurs manquantes .
- Sélectionnez **Supprimer les valeurs manquantes**.
-
Dans le volet Supprimer les valeurs manquantes , sélectionnez les colonnes pour supprimer toute ligne qui a une valeur manquante pour cette colonne.
-
Pour le nom du DataFrame , saisissez un nom pour l'identifiant programmatique du contenu de la table en tant que DataFrame, ou laissez df comme identifiant programmatique par default.
-
Cliquez sur Exécuter .
Supprimer les lignes en double
Scénario : Vous voulez supprimer toute ligne qui a une valeur en double pour les colonnes spécifiées. Par exemple, dans le dataset de Ventes factice, vous souhaitez supprimer les lignes qui sont des doublons exacts les unes des autres.
-
Dans le tab Données , dans la liste déroulante Actions de recherche, effectuez l'une des opérations suivantes :
- Saisissez **drop** ou **remove**, puis sélectionnez **Drop/Remove duplicates**.
- Sélectionnez Supprimer les doublons .
-
Dans le volet **Supprimer les doublons**, sélectionnez les colonnes pour supprimer toute ligne ayant une valeur en double pour ces colonnes, puis sélectionnez si vous souhaitez conserver la première ou la dernière ligne ayant la valeur en double.
-
Pour le nom du DataFrame , saisissez un nom pour l'identifiant programmatique du contenu de la table en tant que DataFrame, ou laissez df comme identifiant programmatique par default.
-
Cliquez sur Exécuter .
Rechercher et remplacer les valeurs manquantes
Scénario : vous souhaitez remplacer la valeur manquante par une valeur de remplacement pour toute ligne avec les colonnes spécifiées. Par exemple, dans l'exemple de dataset Ventes , vous souhaitez remplacer toute ligne avec une valeur manquante dans la colonne item_type par la valeur Unknown Item Type.
-
Dans le tab Données , dans la liste déroulante Actions de recherche, effectuez l'une des opérations suivantes :
- Saisissez rechercher ou remplacer , puis sélectionnez Rechercher et remplacer les valeurs manquantes .
- Sélectionnez Rechercher et remplacer les valeurs manquantes .
-
Dans le volet **Remplacer les valeurs manquantes**, sélectionnez les colonnes pour lesquelles remplacer les valeurs manquantes, puis spécifiez la valeur de remplacement.
-
Cliquez sur Exécuter .
Créer une formule de colonne
Scénario : vous souhaitez créer une colonne qui utilise une formule unique. Par exemple, dans le dataset de Ventes factice, vous souhaitez créer une colonne nommée profit_per_unit qui affiche le résultat de la division de la valeur de la colonne total_profit par la valeur de la colonne units_sold pour chaque ligne.
-
Dans le tab Données , dans la liste déroulante Actions de recherche, effectuez l'une des opérations suivantes :
- Saisissez formula , puis sélectionnez New column formula .
- Sélectionnez **Nouvelle formule de colonne**.
-
Dans le volet **Remplacer les valeurs manquantes**, sélectionnez les colonnes pour lesquelles remplacer les valeurs manquantes, puis spécifiez la valeur de remplacement.
-
Cliquez sur Exécuter .
Tâches d'historique des actions de données
Dans cette section :
- Affichez la liste des actions effectuées dans le widget.
- Annuler l’action la plus récente effectuée dans le widget
- Rétablir la dernière action effectuée dans le widget.
- Modifier la plus récente action effectuée dans le widget
Voir la liste des actions effectuées dans le widget
**Scénario** : vous souhaitez voir une liste de toutes les modifications qui ont été apportées au widget, en commençant par la modification la plus récente.
Cliquez sur Historique . La liste des actions apparaît dans le volet **Historique des Transformations**.
Annuler l'action la plus récente effectuée dans le widget
Scénario : Vous souhaitez annuler la modification la plus récente qui a été apportée au widget.
Effectuez l'une des actions suivantes :
- Cliquez sur l'icône de la flèche antihoraire.
- Cliquez sur **Historique**, puis dans le volet **Historique des Transformations**, cliquez sur **Annuler la dernière étape**.
Rétablir l'action la plus récente effectuée dans le widget
Scénario : Vous souhaitez annuler la dernière annulation effectuée dans le widget.
Effectuez l'une des actions suivantes :
- Cliquez sur l'icône de la flèche dans le sens des aiguilles d'une montre.
- Cliquez sur **Historique**, et dans le volet **Historique des transformations**, cliquez sur **Récupérer la dernière étape**.
Modifier la dernière action effectuée dans le widget
**Scénario** : Vous souhaitez modifier la modification la plus récente apportée au widget.
-
Effectuez l'une des actions suivantes :
- Cliquez sur l'icône en forme de crayon.
- Cliquez sur Historique , puis dans le panneau Historique des transformations , cliquez sur Modifier la dernière étape .
-
Apportez la modification souhaitée, puis cliquez sur Exécuter .
Obtenez le code pour recréer par programmation l'état actuel du widget en tant que DataFrame.
Scénario : Vous voulez obtenir un code Python qui recrée par programmation l'état actuel du widget, représenté comme un DataFrame pandas. Vous voulez exécuter ce code dans une cellule différente de ce classeur ou dans un tout autre classeur.
-
Cliquez sur Obtenir le code .
-
Dans le volet Exporter le code , cliquez sur Copier le code . Le code a été copié dans le presse-papiers de votre système.
-
Collez le code dans une autre cellule de ce classeur ou dans un autre classeur.
-
Écrivez du code supplémentaire pour travailler avec ce DataFrame pandas par programmation, puis exécutez la cellule. Par exemple, pour afficher le contenu du DataFrame, en supposant que votre DataFrame est représenté de manière programmatique par
df:Python# Your pasted code here, followed by...
df
Limitations
Voir Limitations connues des notebooks Databricks pour plus d'informations.