Aller au contenu principal

échantillon

Renvoie un sous-ensemble échantillonné de ce DataFrame.

Syntaxe​

sample(withReplacement: Optional[Union[float, bool]] = None, fraction: Optional[Union[int, float]] = None, seed: Optional[int] = None)

parameter​

parameter

Type

Description

withReplacement

bool, facultatif

Échantillon avec ou sans remplacement (default False).

fraction

flottant, facultatif

Fraction des lignes à générer, plage [0,0, 1,0].

seed

int, facultatif

Graine pour l'échantillonnage (default une graine aléatoire).

parameter

Type

Description

withReplacement

bool, facultatif

Échantillon avec ou sans remplacement (default False).

fraction

flottant, facultatif

Fraction des lignes à générer, plage [0,0, 1,0].

seed

int, facultatif

Graine pour l'échantillonnage (default une graine aléatoire).

Renvoie​

DataFrame: Lignes échantillonnées du DataFrame donné.

Notes​

Cela ne garantit pas de fournir exactement la fraction spécifiée du nombre total du DataFrame donné.

fraction est requis et withReplacement et seed sont facultatifs.

Exemples​

Python
df = spark.range(0, 10, 1, 1)
df.sample(0.5, 3).count()
# 7
df.sample(fraction=0.5, seed=3).count()
# 4
df.sample(withReplacement=True, fraction=0.5, seed=3).count()
# 2
df.sample(1.0).count()
# 10
df.sample(fraction=1.0).count()
# 10
df.sample(False, fraction=1.0).count()
# 10