Aller au contenu principal

sortBy

Trie la sortie de chaque compartiment par les colonnes données sur le système de fichiers.

Syntaxe

sortBy(col, *cols)

parameter

parameter

Type

Description

col

chaîne de caractères, tuple ou liste

Un nom de colonne, ou une liste de noms.

*cols

str, facultatif

Noms de colonne supplémentaires. Doit être vide si col est une liste.

parameter

Type

Description

col

chaîne de caractères, tuple ou liste

Un nom de colonne, ou une liste de noms.

*cols

str, facultatif

Noms de colonne supplémentaires. Doit être vide si col est une liste.

Renvoie

DataFrameWriter

Exemples

Écrire un DataFrame dans une table triée et compartimentée, et le relire.

Python
spark.sql("DROP TABLE IF EXISTS sorted_bucketed_table")
spark.createDataFrame([
(100, "Alice"), (120, "Alice"), (140, "Bob")],
schema=["age", "name"]
).write.bucketBy(1, "name").sortBy("age").mode(
"overwrite").saveAsTable("sorted_bucketed_table")

spark.read.table("sorted_bucketed_table").sort("age").show()
# +---+------------+
# |age| name|
# +---+------------+
# |100|Alice|
# |120|Alice|
# |140| Bob|
# +---+------------+

spark.sql("DROP TABLE sorted_bucketed_table")