Aller au contenu principal

randomSplit

Divise aléatoirement ce DataFrame avec les pondérations fournies.

Syntaxe

randomSplit(weights: List[float], seed: Optional[int] = None)

parameter

parameter

Type

Description

weights

Liste

liste de doubles comme poids pour diviser le DataFrame. Les poids seront normalisés s'ils ne totalisent pas 1,0.

seed

int, facultatif

La graine pour l'échantillonnage.

parameter

Type

Description

weights

Liste

liste de doubles comme poids pour diviser le DataFrame. Les poids seront normalisés s'ils ne totalisent pas 1,0.

seed

int, facultatif

La graine pour l'échantillonnage.

Renvoie

Liste : Liste de DataFrames.

Exemples

Python
from pyspark.sql import Row
df = spark.createDataFrame([
Row(age=10, height=80, name="Alice"),
Row(age=5, height=None, name="Bob"),
Row(age=None, height=None, name="Tom"),
Row(age=None, height=None, name=None),
])

splits = df.randomSplit([1.0, 2.0], 24)
splits[0].count()
# 2
splits[1].count()
# 2