Aller au contenu principal

DataSourceRegistration

Un wrapper pour l'enregistrement de la source de données.

Cette instance est accessible via spark.dataSource. Utilisez-le pour enregistrer une sous-classe DataSource personnalisée afin qu'elle puisse être référencée par son nom dans spark.read.format() et df.write.format().

Syntaxe​

Python
spark.dataSource.register(MyDataSource)

Méthodes​

Méthode

Description

register(dataSource)

Enregistre une source de données définie par l'utilisateur Python. dataSource doit être une sous-classe de DataSource.

Méthode

Description

register(dataSource)

Enregistre une source de données définie par l'utilisateur Python. dataSource doit être une sous-classe de DataSource.

Exemples​

Enregistrez une source de données personnalisée et lisez-en les données :

Python
from pyspark.sql.datasource import DataSource, DataSourceReader

class MyDataSource(DataSource):
@classmethod
def name(cls):
return "my_data_source"

def schema(self):
return "id INT, value STRING"

def reader(self, schema):
return MyDataSourceReader(schema)

class MyDataSourceReader(DataSourceReader):
def read(self, partition):
yield (1, "hello")
yield (2, "world")

spark.dataSource.register(MyDataSource)
df = spark.read.format("my_data_source").load()
df.show()