Enregistrer les DataFrames Apache Spark en tant que fichiers TFRecord
Cet article vous explique comment utiliser spark-tensorflow-connector pour enregistrer des DataFrames Apache Spark dans des fichiers TFRecord et charger TFRecord avec TensorFlow.
Le format de fichier TFRecord est un format binaire simple orienté enregistrement pour les données d'entraînement ML. La classe tf.data.TFRecordDataset vous permet de Stream le contenu d’un ou plusieurs fichiers TFRecord dans le cadre d’un pipeline d’entrée.
Utilisez la bibliothèque spark-tensorflow-connector
Vous pouvez utiliser spark-tensorflow-connector pour enregistrer les DataFrames Apache Spark dans des fichiers TFRecord.
spark-tensorflow-connector est une bibliothèque au sein de l’ écosystème TensorFlow
qui permet la conversion entre les DataFrames Spark et les TFRecords (un format populaire pour stocker des données pour TensorFlow). Avec spark-tensorflow-connector, vous pouvez utiliser les APIs Spark DataFrame pour lire les fichiers TFRecords dans les DataFrames et écrire les DataFrames en tant que TFRecords.
La bibliothèque spark-tensorflow-connector est incluse dans Databricks Runtime for Machine Learning. Pour utiliser spark-tensorflow-connector sur les versions des notes de publication et la compatibilité de Databricks Runtime, vous devez installer la bibliothèque à partir de Maven. Consultez la section package Maven ou Spark pour plus de détails.
Exemple : Charger les données des fichiers TFRecord avec TensorFlow
Le notebook d'exemple montre comment enregistrer des données à partir de DataFrames Apache Spark dans des fichiers TFRecord et charger des fichiers TFRecord pour la formation ML.
Vous pouvez charger les fichiers TFRecord en utilisant la classe tf.data.TFRecordDataset. Pour plus de détails, consultez Lecture d'un fichier TFRecord de TensorFlow.