Chargez les données pour le Machine Learning et le Deep Learning
Cette section couvre les informations sur le chargement des données spécifiquement pour les applications de ML et de DL. Pour des informations générales sur le chargement des données, consultez Connecteurs standard dans Lakeflow Connect.
Stockez les fichiers pour le chargement de données et les points de contrôle des modèles
Les applications de Machine Learning peuvent avoir besoin d'utiliser un stockage partagé pour le chargement des données et la création de points de contrôle des modèles. C'est particulièrement important pour le deep learning distribué.
Databricks propose Unity Catalog, une solution de gouvernance unifiée pour les assets de données et d'IA. Vous pouvez utiliser Unity Catalog pour accéder aux données sur un cluster en utilisant les API Spark et les API de fichiers locaux.
Charger des données tabulaires
Vous pouvez charger des données de Machine Learning tabulaires à partir de tables ou de fichiers (par exemple, consultez Lire et écrire des fichiers CSV). Vous pouvez convertir les DataFrames Apache Spark en DataFrames Pandas à l’aide de la méthode PySpark toPandas(), puis éventuellement les convertir au format NumPy à l’aide de la méthode PySpark to_numpy().
Préparer les données pour affiner les grands modèles de langage
Vous pouvez préparer vos données pour l’affinement de grands modèles de langage open source avec Hugging Face Transformers et les jeux de données Hugging Face.
Préparer les données pour l'affinement des modèles Hugging Face
Préparez les données pour l'entraînement distribué de deep learning
Cette section couvre la préparation des données pour l'entraînement de deep learning distribué.
Pour les très grands datasets qui ne tiennent pas en mémoire, utilisez les approches de streaming :
- PyTorch IterableDataset pour une logique de streaming personnalisée.
- Datasets Hugging Face avec streaming pour les datasets hébergés sur le Hub ou dans des volumes.
- Ray Data pour le traitement distribué des données par batch.