Aller au contenu principal

Chargez les données pour le Machine Learning et le Deep Learning

Cette section couvre les informations sur le chargement des données spécifiquement pour les applications de ML et de DL. Pour des informations générales sur le chargement des données, consultez Connecteurs standard dans Lakeflow Connect.

Stockez les fichiers pour le chargement de données et les points de contrôle des modèles

Les applications de Machine Learning peuvent avoir besoin d'utiliser un stockage partagé pour le chargement des données et la création de points de contrôle des modèles. C'est particulièrement important pour le deep learning distribué.

Databricks propose Unity Catalog, une solution de gouvernance unifiée pour les assets de données et d'IA. Vous pouvez utiliser Unity Catalog pour accéder aux données sur un cluster en utilisant les API Spark et les API de fichiers locaux.

Charger des données tabulaires

Vous pouvez charger des données de Machine Learning tabulaires à partir de tables ou de fichiers (par exemple, consultez Lire et écrire des fichiers CSV). Vous pouvez convertir les DataFrames Apache Spark en DataFrames Pandas à l’aide de la méthode PySpark toPandas(), puis éventuellement les convertir au format NumPy à l’aide de la méthode PySpark to_numpy().

Préparer les données pour affiner les grands modèles de langage

Vous pouvez préparer vos données pour l’affinement de grands modèles de langage open source avec Hugging Face Transformers et les jeux de données Hugging Face.

Préparer les données pour l'affinement des modèles Hugging Face

Préparez les données pour l'entraînement distribué de deep learning

Cette section couvre la préparation des données pour l'entraînement de deep learning distribué.

Pour les très grands datasets qui ne tiennent pas en mémoire, utilisez les approches de streaming :