Aller au contenu principal

width_bucket

Renvoie le numéro de compartiment dans lequel la valeur de cette expression tomberait après avoir été évaluée. Veuillez noter que les arguments d’entrée doivent respecter les conditions énumérées ci-dessous ; sinon, la méthode renverra une valeur nulle. Prend en charge Spark Connect.

Pour la fonction Databricks SQL correspondante, consultez la fonctionwidth_bucket.

Syntaxe

Python
from pyspark.sql import functions as dbf

dbf.width_bucket(v=<v>, min=<min>, max=<max>, numBucket=<numBucket>)

parameter

parameter

Type

Description

v

pyspark.sql.Column or column name

valeur pour calculer un numéro de compartiment dans l'histogramme

min

pyspark.sql.Column or column name

valeur minimale de l'histogramme

max

pyspark.sql.Column or column name

valeur maximale de l'histogramme

numBucket

pyspark.sql.Column, column name or int

le nombre de compartiments

parameter

Type

Description

v

pyspark.sql.Column or column name

valeur pour calculer un numéro de compartiment dans l'histogramme

min

pyspark.sql.Column or column name

valeur minimale de l'histogramme

max

pyspark.sql.Column or column name

valeur maximale de l'histogramme

numBucket

pyspark.sql.Column, column name or int

le nombre de compartiments

Renvoie

pyspark.sql.Column: le numéro du compartiment dans lequel la valeur tomberait après avoir été évaluée

Exemples

Python
from pyspark.sql import functions as dbf
df = spark.createDataFrame([
(5.3, 0.2, 10.6, 5),
(-2.1, 1.3, 3.4, 3),
(8.1, 0.0, 5.7, 4),
(-0.9, 5.2, 0.5, 2)],
['v', 'min', 'max', 'n'])
df.select("*", dbf.width_bucket('v', 'min', 'max', 'n')).show()
Output
+----+---+----+---+----------------------------+
| v|min| max| n|width_bucket(v, min, max, n)|
+----+---+----+---+----------------------------+
| 5.3|0.2|10.6| 5| 3|
|-2.1|1.3| 3.4| 3| 0|
| 8.1|0.0| 5.7| 4| 5|
|-0.9|5.2| 0.5| 2| 3|
+----+---+----+---+----------------------------+