repartition
Renvoie un nouveau DataFrame partitionné par les expressions de partitionnement données. Le DataFrame résultant est partitionné par hachage.
Syntaxe
repartition(numPartitions: Union[int, "ColumnOrName"], *cols: "ColumnOrName")
parameter
parameter | Type | Description |
|---|---|---|
| int | peut être un entier pour spécifier le nombre cible de partitions ou une colonne. S'il s'agit d'une colonne, elle sera utilisée comme première colonne de partitionnement. S'il n'est pas spécifié, le nombre de partitions default est utilisé. |
| str or Column | colonnes de partitionnement. |
Renvoie
DataFrame: DataFrame repartitionné.
Exemples
Python
from pyspark.sql import functions as sf
df = spark.range(0, 64, 1, 9).withColumn(
"name", sf.concat(sf.lit("name_"), sf.col("id").cast("string"))
).withColumn(
"age", sf.col("id") - 32
)
df.repartition(10).select(
sf.spark_partition_id().alias("partition")
).distinct().sort("partition").show()
# +---------+
# |partition|
# +---------+
# | 0|
# ...
# | 9|
# +---------+
df.repartition(7, "age").select(
sf.spark_partition_id().alias("partition")
).distinct().sort("partition").show()
# +---------+
# |partition|
# +---------+
# | 0|
# ...
# | 6|
# +---------+