partitioning.bucket
Une transformation pour tout type qui partitionne par un hachage de la colonne d'entrée.
remarque
Cette fonction ne peut être utilisée qu'en combinaison avec la méthode DataFrameWriterV2.partitionedBy.
Syntaxe
Python
from pyspark.sql.functions import partitioning
partitioning.bucket(numBuckets, col)
parameter
parameter | Type | Description |
|---|---|---|
|
| Le nombre de compartiments. |
|
| Ciblez la colonne de date ou de Timestamp sur laquelle travailler. |
Exemples
Python
from pyspark.sql.functions import partitioning
df.writeTo("catalog.db.table").partitionedBy(
partitioning.bucket(42, "ts")
).createOrReplace()