Aller au contenu principal

sampleBy (DataFrameStatFunctions)

Renvoie un échantillon stratifié sans remplacement basé sur la fraction donnée sur chaque strate.

Syntaxe​

sampleBy(col, fractions, seed=None)

parameter​

parameter

Type

Description

col

str

La colonne qui définit les strates.

fractions

dict

La fraction d'échantillonnage pour chaque strate. Les strates non spécifiées sont traitées comme ayant une fraction nulle.

seed

int, facultatif

Graine aléatoire.

parameter

Type

Description

col

str

La colonne qui définit les strates.

fractions

dict

La fraction d'échantillonnage pour chaque strate. Les strates non spécifiées sont traitées comme ayant une fraction nulle.

seed

int, facultatif

Graine aléatoire.

Renvoie​

DataFrame

Exemples​

Python
from pyspark.sql import functions as sf
dataset = spark.range(0, 100, 1, 5).select((sf.col("id") % 3).alias("key"))
sampled = dataset.stat.sampleBy("key", fractions={0: 0.1, 1: 0.2}, seed=0)
sampled.groupBy("key").count().orderBy("key").show()
# +---+-----+
# |key|count|
# +---+-----+
# | 0| 4|
# | 1| 9|
# +---+-----+