Aller au contenu principal

ignorer (DataFrameNaFunctions)

Renvoie un nouveau DataFrame en omettant les lignes avec des valeurs nulles ou NaN. DataFrame.dropna et DataFrameNaFunctions.drop sont des alias l'un de l'autre.

Syntaxe

drop(how='any', thresh=None, subset=None)

parameter

parameter

Type

Description

how

str, facultatif

Faut-il supprimer une ligne si elle contient des valeurs nulles ou seulement si toutes ses valeurs sont nulles. Les valeurs acceptées sont 'any' (default) et 'all'. Si thresh est spécifié, how est ignoré.

thresh

int, facultatif

Si spécifié, supprimez les lignes qui comportent moins de thresh valeurs non nulles. Remplace how.

subset

str, tuple ou list, facultatif

Noms de colonne à prendre en compte lors de la vérification des valeurs nulles ou NaN.

parameter

Type

Description

how

str, facultatif

Faut-il supprimer une ligne si elle contient des valeurs nulles ou seulement si toutes ses valeurs sont nulles. Les valeurs acceptées sont 'any' (default) et 'all'. Si thresh est spécifié, how est ignoré.

thresh

int, facultatif

Si spécifié, supprimez les lignes qui comportent moins de thresh valeurs non nulles. Remplace how.

subset

str, tuple ou list, facultatif

Noms de colonne à prendre en compte lors de la vérification des valeurs nulles ou NaN.

Renvoie

DataFrame

Exemples

Python
from pyspark.sql import Row
df = spark.createDataFrame([
Row(age=10, height=80.0, name="Alice"),
Row(age=5, height=float("nan"), name="Bob"),
Row(age=None, height=None, name="Tom"),
Row(age=None, height=float("nan"), name=None),
])

Supprimez la ligne si elle contient une valeur nulle ou NaN.

Python
df.na.drop().show()
# +---+------+-----+
# |age|height| name|
# +---+------+-----+
# | 10| 80.0|Alice|
# +---+------+-----+

Supprimez la ligne uniquement si toutes ses valeurs sont nulles ou NaN.

Python
df.na.drop(how='all').show()
# +----+------+-----+
# | age|height| name|
# +----+------+-----+
# | 10| 80.0|Alice|
# | 5| NaN| Bob|
# |NULL| NULL| Tom|
# +----+------+-----+

Supprimez les lignes qui comportent moins de thresh valeurs non nulles et non-NaN.

Python
df.na.drop(thresh=2).show()
# +---+------+-----+
# |age|height| name|
# +---+------+-----+
# | 10| 80.0|Alice|
# | 5| NaN| Bob|
# +---+------+-----+

Supprimez les lignes avec des valeurs null et NaN dans les colonnes spécifiées.

Python
df.na.drop(subset=['age', 'name']).show()
# +---+------+-----+
# |age|height| name|
# +---+------+-----+
# | 10| 80.0|Alice|
# | 5| NaN| Bob|
# +---+------+-----+