Pular para o conteúdo principal

ordenar por

Ordena a saída em cada bucket pelas colunas especificadas no sistema de arquivos.

Sintaxe

sortBy(col, *cols)

Parâmetros

Parâmetro

Tipo

Descrição

col

string, tupla ou lista

Um nome de coluna ou uma lista de nomes.

*cols

str, opcional

Nomes de colunas adicionais. Deve estar vazio se col for uma lista.

Parâmetro

Tipo

Descrição

col

string, tupla ou lista

Um nome de coluna ou uma lista de nomes.

*cols

str, opcional

Nomes de colunas adicionais. Deve estar vazio se col for uma lista.

Devoluções

DataFrameWriter

Exemplos

Escreva um DataFrame em uma tabela ordenada e categorizada, e leia-o de volta.

Python
spark.sql("DROP TABLE IF EXISTS sorted_bucketed_table")
spark.createDataFrame([
(100, "Alice"), (120, "Alice"), (140, "Bob")],
schema=["age", "name"]
).write.bucketBy(1, "name").sortBy("age").mode(
"overwrite").saveAsTable("sorted_bucketed_table")

spark.read.table("sorted_bucketed_table").sort("age").show()
# +---+------------+
# |age| name|
# +---+------------+
# |100|Alice|
# |120|Alice|
# |140| Bob|
# +---+------------+

spark.sql("DROP TABLE sorted_bucketed_table")