Aller au contenu principal

Classe DataFrameNaFunctions

Fonctionnalités pour travailler avec les données manquantes dans un DataFrame.

Prend en charge Spark Connect

Syntaxe

Python
DataFrame.na

Méthodes

Méthode

Description

drop(how, thresh, subset)

Renvoie un nouveau DataFrame omettant les lignes avec des valeurs nulles ou NaN.

fill(value, subset)

Renvoie un nouveau DataFrame avec les valeurs nulles remplacées par la valeur spécifiée.

replace(to_replace, value, subset)

Renvoie un nouveau DataFrame remplaçant une valeur par une autre valeur.

Méthode

Description

drop(how, thresh, subset)

Renvoie un nouveau DataFrame omettant les lignes avec des valeurs nulles ou NaN.

fill(value, subset)

Renvoie un nouveau DataFrame avec les valeurs nulles remplacées par la valeur spécifiée.

replace(to_replace, value, subset)

Renvoie un nouveau DataFrame remplaçant une valeur par une autre valeur.

Exemples

Supprimer les lignes avec des valeurs nulles

Python
from pyspark.sql import Row

df = spark.createDataFrame([
Row(age=10, height=80.0, name="Alice"),
Row(age=5, height=None, name="Bob"),
Row(age=None, height=None, name="Tom"),
])

df.na.drop().show()
Output
+---+------+-----+
|age|height| name|
+---+------+-----+
| 10| 80.0|Alice|
+---+------+-----+

Remplir les valeurs nulles

Python
df = spark.createDataFrame([
(10, 80.5, "Alice"),
(5, None, "Bob"),
(None, None, "Tom")],
schema=["age", "height", "name"])

df.na.fill({'age': 50, 'name': 'unknown'}).show()
Output
+---+------+-------+
|age|height| name|
+---+------+-------+
| 10| 80.5| Alice|
| 5| NULL| Bob|
| 50| NULL|unknown|
+---+------+-------+

Remplacer les valeurs

Python
df = spark.createDataFrame([
(10, 80, "Alice"),
(5, None, "Bob"),
(None, 10, "Tom")],
schema=["age", "height", "name"])

df.na.replace(['Alice', 'Bob'], ['A', 'B'], 'name').show()
Output
+----+------+----+
| age|height|name|
+----+------+----+
| 10| 80| A|
| 5| NULL| B|
|NULL| 10| Tom|
+----+------+----+