Aller au contenu principal

cume_dist

Fonction de fenêtre : renvoie la distribution cumulative des valeurs dans une partition de fenêtre, c'est-à-dire la fraction de lignes inférieures à la ligne actuelle.

Syntaxe

Python
from pyspark.sql import functions as sf

sf.cume_dist()

parameter

Cette fonction ne prend aucun paramètre.

Renvoie

pyspark.sql.Column: la colonne pour le calcul de la distribution cumulative.

Exemples

Python
from pyspark.sql import functions as sf
from pyspark.sql import Window
df = spark.createDataFrame([1, 2, 3, 3, 4], "int")
w = Window.orderBy("value")
df.withColumn("cd", sf.cume_dist().over(w)).show()
Output
+-----+---+
|value| cd|
+-----+---+
| 1|0.2|
| 2|0.4|
| 3|0.8|
| 3|0.8|
| 4|1.0|
+-----+---+