Aller au contenu principal

Préparez les données pour l'entraînement distribué

Cet article décrit des méthodes pour préparer les données pour la formation distribuée.

Pour les très grands datasets qui ne tiennent pas en mémoire, utilisez les approches de streaming :

TFRecord

Vous pouvez également utiliser le format TFRecord comme source de données pour le deep learning distribué. Le format TFRecord est un format binaire simple orienté enregistrement que de nombreuses applications TensorFlow utilisent pour les données d'entraînement.

tf.data.TFRecordDataset est le dataset TensorFlow, qui est composé d’enregistrements de fichiers TFRecords. Pour plus de détails sur la façon de consommer les données TFRecord, consultez le guide TensorFlow Consommer les données TFRecord.

Les articles suivants décrivent et illustrent les méthodes recommandées pour enregistrer vos données dans des fichiers TFRecord et charger des fichiers TFRecord :

Sur cette page