Aller au contenu principal

échantillon

Renvoie un sous-ensemble échantillonné de ce DataFrame.

Syntaxe

sample(withReplacement: Optional[Union[float, bool]] = None, fraction: Optional[Union[int, float]] = None, seed: Optional[int] = None)

parameter

parameter

Type

Description

withReplacement

bool, facultatif

Échantillon avec ou sans remplacement (default False).

fraction

flottant, facultatif

Fraction des lignes à générer, plage [0,0, 1,0].

seed

int, facultatif

Graine pour l'échantillonnage (default une graine aléatoire).

parameter

Type

Description

withReplacement

bool, facultatif

Échantillon avec ou sans remplacement (default False).

fraction

flottant, facultatif

Fraction des lignes à générer, plage [0,0, 1,0].

seed

int, facultatif

Graine pour l'échantillonnage (default une graine aléatoire).

Renvoie

DataFrame: Lignes échantillonnées du DataFrame donné.

Notes

Cela ne garantit pas de fournir exactement la fraction spécifiée du nombre total du DataFrame donné.

fraction est requis et withReplacement et seed sont facultatifs.

Exemples

Python
df = spark.range(0, 10, 1, 1)
df.sample(0.5, 3).count()
# 7
df.sample(fraction=0.5, seed=3).count()
# 4
df.sample(withReplacement=True, fraction=0.5, seed=3).count()
# 2
df.sample(1.0).count()
# 10
df.sample(fraction=1.0).count()
# 10
df.sample(False, fraction=1.0).count()
# 10