échantillon
Renvoie un sous-ensemble échantillonné de ce DataFrame.
Syntaxe
sample(withReplacement: Optional[Union[float, bool]] = None, fraction: Optional[Union[int, float]] = None, seed: Optional[int] = None)
parameter
parameter | Type | Description |
|---|---|---|
| bool, facultatif | Échantillon avec ou sans remplacement (default |
| flottant, facultatif | Fraction des lignes à générer, plage [0,0, 1,0]. |
| int, facultatif | Graine pour l'échantillonnage (default une graine aléatoire). |
Renvoie
DataFrame: Lignes échantillonnées du DataFrame donné.
Notes
Cela ne garantit pas de fournir exactement la fraction spécifiée du nombre total du DataFrame donné.
fraction est requis et withReplacement et seed sont facultatifs.
Exemples
Python
df = spark.range(0, 10, 1, 1)
df.sample(0.5, 3).count()
# 7
df.sample(fraction=0.5, seed=3).count()
# 4
df.sample(withReplacement=True, fraction=0.5, seed=3).count()
# 2
df.sample(1.0).count()
# 10
df.sample(fraction=1.0).count()
# 10
df.sample(False, fraction=1.0).count()
# 10