Aller au contenu principal

Texte (DataFrameReader)

Charge les fichiers texte et renvoie un DataFrame dont le schéma commence par une colonne de chaînes nommée value, suivie des colonnes partitionnées si elles sont présentes. Les fichiers texte doivent être encodés en UTF-8. By default, chaque ligne du fichier texte est une nouvelle ligne dans le DataFrame résultant.

Syntaxe

text(paths, wholetext=False, lineSep=None, **options)

parameter

parameter

Type

Description

paths

str ou list

Un ou plusieurs chemins d'entrée.

wholetext

bool, facultatif

Si True, lisez chaque fichier comme une seule ligne. La valeur par default est False.

lineSep

str, facultatif

Le séparateur de lignes à utiliser. Par default, c'est '\n', '\r', ou '\r\n'.

parameter

Type

Description

paths

str ou list

Un ou plusieurs chemins d'entrée.

wholetext

bool, facultatif

Si True, lisez chaque fichier comme une seule ligne. La valeur par default est False.

lineSep

str, facultatif

Le séparateur de lignes à utiliser. Par default, c'est '\n', '\r', ou '\r\n'.

Renvoie

DataFrame

Exemples

Écrivez un DataFrame dans un fichier texte et relisez-le.

Python
import tempfile
with tempfile.TemporaryDirectory(prefix="text") as d:
df = spark.createDataFrame([("a",), ("b",), ("c",)], schema=["alphabets"])
df.write.mode("overwrite").format("text").save(d)

spark.read.schema(df.schema).text(d).sort("alphabets").show()
# +---------+
# |alphabets|
# +---------+
# | a|
# | b|
# | c|
# +---------+