Aller au contenu principal

Chargement

Charge les données d'une source de données et les retourne en tant que DataFrame.

Syntaxe

load(path=None, format=None, schema=None, **options)

parameter

parameter

Type

Description

path

chaîne ou liste, facultatif

Un ou plusieurs chemins dans une source de données basée sur un système de fichiers.

format

str, facultatif

Le format de la source de données. La valeur default est 'parquet'.

schema

StructType ou str, facultatif.

Le schéma d'entrée en tant qu'objet StructType ou une chaîne au format DDL (par exemple, 'col0 INT, col1 DOUBLE').

**options

dict

Options de chaîne supplémentaires.

parameter

Type

Description

path

chaîne ou liste, facultatif

Un ou plusieurs chemins dans une source de données basée sur un système de fichiers.

format

str, facultatif

Le format de la source de données. La valeur default est 'parquet'.

schema

StructType ou str, facultatif.

Le schéma d'entrée en tant qu'objet StructType ou une chaîne au format DDL (par exemple, 'col0 INT, col1 DOUBLE').

**options

dict

Options de chaîne supplémentaires.

Renvoie

DataFrame

Exemples

Chargez un fichier CSV avec le format, le schéma et les options spécifiés.

Python
import tempfile
with tempfile.TemporaryDirectory(prefix="load") as d:
df = spark.createDataFrame([{"age": 100, "name": "Alice"}])
df.write.option("header", True).mode("overwrite").format("csv").save(d)

df = spark.read.load(
d, schema=df.schema, format="csv", nullValue="Alice", header=True)
df.printSchema()
# root
# |-- age: long (nullable = true)
# |-- name: string (nullable = true)
df.show()
# +---+----+
# |age|name|
# +---+----+
# |100|NULL|
# +---+----+