Aller au contenu principal

sampleBy (DataFrameStatFunctions)

Renvoie un échantillon stratifié sans remplacement basé sur la fraction donnée sur chaque strate.

Syntaxe

sampleBy(col, fractions, seed=None)

parameter

parameter

Type

Description

col

str

La colonne qui définit les strates.

fractions

dict

La fraction d'échantillonnage pour chaque strate. Les strates non spécifiées sont traitées comme ayant une fraction nulle.

seed

int, facultatif

Graine aléatoire.

parameter

Type

Description

col

str

La colonne qui définit les strates.

fractions

dict

La fraction d'échantillonnage pour chaque strate. Les strates non spécifiées sont traitées comme ayant une fraction nulle.

seed

int, facultatif

Graine aléatoire.

Renvoie

DataFrame

Exemples

Python
from pyspark.sql import functions as sf
dataset = spark.range(0, 100, 1, 5).select((sf.col("id") % 3).alias("key"))
sampled = dataset.stat.sampleBy("key", fractions={0: 0.1, 1: 0.2}, seed=0)
sampled.groupBy("key").count().orderBy("key").show()
# +---+-----+
# |key|count|
# +---+-----+
# | 0| 4|
# | 1| 9|
# +---+-----+