Aller au contenu principal

Parquet (DataFrameWriter)

Enregistre le contenu du DataFrame au format Parquet au chemin spécifié.

Syntaxe

parquet(path, mode=None, partitionBy=None, compression=None)

parameter

parameter

Type

Description

path

str

Le chemin dans tout système de fichiers pris en charge par Hadoop.

mode

str, facultatif

Le comportement lorsque des données existent déjà. Les valeurs acceptées sont 'append', 'overwrite', 'ignore' et 'error' ou 'errorifexists' (default).

partitionBy

chaîne ou liste, facultatif

Noms des colonnes de partitionnement.

compression

str, facultatif

Le codec de compression à utiliser.

parameter

Type

Description

path

str

Le chemin dans tout système de fichiers pris en charge par Hadoop.

mode

str, facultatif

Le comportement lorsque des données existent déjà. Les valeurs acceptées sont 'append', 'overwrite', 'ignore' et 'error' ou 'errorifexists' (default).

partitionBy

chaîne ou liste, facultatif

Noms des colonnes de partitionnement.

compression

str, facultatif

Le codec de compression à utiliser.

Renvoie

Aucun

Exemples

Écrivez un DataFrame dans un fichier Parquet et relisez-le.

Python
import tempfile
with tempfile.TemporaryDirectory(prefix="parquet") as d:
spark.createDataFrame(
[{"age": 100, "name": "Alice"}]
).write.parquet(d, mode="overwrite")

spark.read.format("parquet").load(d).show()
# +---+------------+
# |age| name|
# +---+------------+
# |100|Alice|
# +---+------------+