Aller au contenu principal

lecture (DataSourceStreamReader)

Génère des données pour une partition donnée et renvoie un itérateur de tuples ou de lignes.

Cette méthode est invoquée une fois par partition pour lire les données. L'implémentation de cette méthode est requise pour les lecteurs de Stream. Vous pouvez initialiser toutes les ressources non sérialisables nécessaires pour lire les données de la source de données dans cette méthode.

Ajouté dans Databricks Runtime 15.2

Syntaxe

read(partition: InputPartition)

parameter

parameter

Type

Description

partition

InputPartition

La partition à lire. Il doit s'agir de l'une des valeurs de partition renvoyées par partitions().

parameter

Type

Description

partition

InputPartition

La partition à lire. Il doit s'agir de l'une des valeurs de partition renvoyées par partitions().

Renvoie

Iterator[Tuple] OU Iterator[RecordBatch]

Un itérateur de tuples ou de lignes. Chaque tuple ou ligne sera converti en ligne dans le DataFrame final. Il peut également renvoyer un itérateur d'objets PyArrow RecordBatch si la source de données le prend en charge.

Notes

Cette méthode est statique et sans état. N'accédez pas aux membres mutables de la classe et ne conservez pas d'état en mémoire entre les différentes invocations de read().