Aller au contenu principal

Classe DataFrameNaFunctions

Fonctionnalités pour travailler avec les données manquantes dans un DataFrame.

Prend en charge Spark Connect

Syntaxe​

Python
DataFrame.na

Méthodes​

Méthode

Description

drop(how, thresh, subset)

Renvoie un nouveau DataFrame omettant les lignes avec des valeurs nulles ou NaN.

fill(value, subset)

Renvoie un nouveau DataFrame avec les valeurs nulles remplacées par la valeur spécifiée.

replace(to_replace, value, subset)

Renvoie un nouveau DataFrame remplaçant une valeur par une autre valeur.

Méthode

Description

drop(how, thresh, subset)

Renvoie un nouveau DataFrame omettant les lignes avec des valeurs nulles ou NaN.

fill(value, subset)

Renvoie un nouveau DataFrame avec les valeurs nulles remplacées par la valeur spécifiée.

replace(to_replace, value, subset)

Renvoie un nouveau DataFrame remplaçant une valeur par une autre valeur.

Exemples​

Supprimer les lignes avec des valeurs nulles​

Python
from pyspark.sql import Row

df = spark.createDataFrame([
Row(age=10, height=80.0, name="Alice"),
Row(age=5, height=None, name="Bob"),
Row(age=None, height=None, name="Tom"),
])

df.na.drop().show()
Output
+---+------+-----+
|age|height| name|
+---+------+-----+
| 10| 80.0|Alice|
+---+------+-----+

Remplir les valeurs nulles​

Python
df = spark.createDataFrame([
(10, 80.5, "Alice"),
(5, None, "Bob"),
(None, None, "Tom")],
schema=["age", "height", "name"])

df.na.fill({'age': 50, 'name': 'unknown'}).show()
Output
+---+------+-------+
|age|height| name|
+---+------+-------+
| 10| 80.5| Alice|
| 5| NULL| Bob|
| 50| NULL|unknown|
+---+------+-------+

Remplacer les valeurs​

Python
df = spark.createDataFrame([
(10, 80, "Alice"),
(5, None, "Bob"),
(None, 10, "Tom")],
schema=["age", "height", "name"])

df.na.replace(['Alice', 'Bob'], ['A', 'B'], 'name').show()
Output
+----+------+----+
| age|height|name|
+----+------+----+
| 10| 80| A|
| 5| NULL| B|
|NULL| 10| Tom|
+----+------+----+