Aller au contenu principal

partitionBy (DataStreamWriter)

Partitionne la sortie par les colonnes spécifiées sur le système de fichiers. La sortie est structurée de manière similaire au schéma de partitionnement de Hive.

Syntaxe

partitionBy(*cols)

parameter

parameter

Type

Description

*cols

str ou list

Noms des colonnes par lesquelles partitionner.

parameter

Type

Description

*cols

str ou list

Noms des colonnes par lesquelles partitionner.

Renvoie

DataStreamWriter

Exemples

Python
df = spark.readStream.format("rate").load()
df.writeStream.partitionBy("value")
# <...streaming.readwriter.DataStreamWriter object ...>

Partitionner un stream source Rate par Timestamp et écrire au format Parquet :

Python
import tempfile
import time
with tempfile.TemporaryDirectory(prefix="partitionBy1") as d:
with tempfile.TemporaryDirectory(prefix="partitionBy2") as cp:
df = spark.readStream.format("rate").option("rowsPerSecond", 10).load()
q = df.writeStream.partitionBy(
"timestamp").format("parquet").option("checkpointLocation", cp).start(d)
time.sleep(5)
q.stop()
spark.read.schema(df.schema).parquet(d).show()