Aller au contenu principal

schéma (DataStreamReader)

Spécifie le schéma d'entrée. Certaines sources de données (par exemple, JSON) peuvent inférer automatiquement le schéma d'entrée à partir des données. Le fait de spécifier le schéma ici permet à la source de données de passer l’inférence du schéma et d’accélérer le chargement des données.

Syntaxe

schema(schema)

parameter

parameter

Type

Description

schema

StructType ou str

Un objet StructType ou une chaîne au format DDL (par exemple, col0 INT, col1 DOUBLE).

parameter

Type

Description

schema

StructType ou str

Un objet StructType ou une chaîne au format DDL (par exemple, col0 INT, col1 DOUBLE).

Renvoie

DataStreamReader

Exemples

Python
from pyspark.sql.types import StructField, StructType, StringType
spark.readStream.schema(StructType([StructField("data", StringType(), True)]))
# <...streaming.readwriter.DataStreamReader object ...>
spark.readStream.schema("col0 INT, col1 DOUBLE")
# <...streaming.readwriter.DataStreamReader object ...>

Spécifiez un schéma différent pour un fichier CSV :

Python
import tempfile
with tempfile.TemporaryDirectory(prefix="schema") as d:
spark.readStream.schema("col0 INT, col1 STRING").format("csv").load(d).printSchema()
# root
# |-- col0: integer (nullable = true)
# |-- col1: string (nullable = true)