Aller au contenu principal

DataSourceRegistration

Un wrapper pour l'enregistrement de la source de données.

Cette instance est accessible via spark.dataSource. Utilisez-le pour enregistrer une sous-classe DataSource personnalisée afin qu'elle puisse être référencée par son nom dans spark.read.format() et df.write.format().

Syntaxe

Python
spark.dataSource.register(MyDataSource)

Méthodes

Méthode

Description

register(dataSource)

Enregistre une source de données définie par l'utilisateur Python. dataSource doit être une sous-classe de DataSource.

Méthode

Description

register(dataSource)

Enregistre une source de données définie par l'utilisateur Python. dataSource doit être une sous-classe de DataSource.

Exemples

Enregistrez une source de données personnalisée et lisez-en les données :

Python
from pyspark.sql.datasource import DataSource, DataSourceReader

class MyDataSource(DataSource):
@classmethod
def name(cls):
return "my_data_source"

def schema(self):
return "id INT, value STRING"

def reader(self, schema):
return MyDataSourceReader(schema)

class MyDataSourceReader(DataSourceReader):
def read(self, partition):
yield (1, "hello")
yield (2, "world")

spark.dataSource.register(MyDataSource)
df = spark.read.format("my_data_source").load()
df.show()