Aller au contenu principal

Résumé

Calcule les statistiques spécifiées pour les colonnes numériques et de chaîne. Les statistiques disponibles sont : nombre, moyenne, écart type, min, max, percentiles approximatifs arbitraires spécifiés en pourcentage (par ex., 75 %).

Syntaxe

summary(*statistics: str)

parameter

parameter

Type

Description

statistics

str, facultatif

Noms de colonne pour calculer les statistiques (par default, toutes les colonnes).

parameter

Type

Description

statistics

str, facultatif

Noms de colonne pour calculer les statistiques (par default, toutes les colonnes).

Renvoie

DataFrame: Un nouveau DataFrame qui fournit des statistiques pour le DataFrame donné.

Notes

Cette fonction est destinée à l'analyse exploratoire des données, car nous ne garantissons pas la rétrocompatibilité du schéma du DataFrame résultant.

Exemples

Python
df = spark.createDataFrame(
[("Bob", 13, 40.3, 150.5), ("Alice", 12, 37.8, 142.3), ("Tom", 11, 44.1, 142.2)],
["name", "age", "weight", "height"],
)
df.select("age", "weight", "height").summary().show()
# +-------+----+------------------+-----------------+
# |summary| age| weight| height|
# +-------+----+------------------+-----------------+
# | count| 3| 3| 3|
# | mean|12.0| 40.73333333333333| 145.0|
# | stddev| 1.0|3.1722757341273704|4.763402145525822|
# | min| 11| 37.8| 142.2|
# | 25%| 11| 37.8| 142.2|
# | 50%| 12| 40.3| 142.3|
# | 75%| 13| 44.1| 150.5|
# | max| 13| 44.1| 150.5|
# +-------+----+------------------+-----------------+

df.select("age", "weight", "height").summary("count", "min", "25%", "75%", "max").show()
# +-------+---+------+------+
# |summary|age|weight|height|
# +-------+---+------+------+
# | count| 3| 3| 3|
# | min| 11| 37.8| 142.2|
# | 25%| 11| 37.8| 142.2|
# | 75%| 13| 44.1| 150.5|
# | max| 13| 44.1| 150.5|
# +-------+---+------+------+