Que sont les volumes ?
Les volumes sont des objets Unity Catalog qui régissent l'accès aux données non tabulaires. Ils fournissent une couche logique sur le stockage d'objets cloud afin que vous puissiez stocker, organiser et gérer des fichiers avec une gouvernance centralisée.
Pour une documentation complète sur les volumes, consultez Qu'est-ce que les volumes Unity Catalog ?.
Unity Catalog prend en charge deux types de volumes :
- **Volumes gérés :** Databricks gère le cycle de vie et l'emplacement de stockage cloud
- Volumes externes : Vous contrôlez l’emplacement de stockage dans le cloud et le cycle de vie.
Que pouvez-vous faire avec les volumes Unity Catalog ?
Vous pouvez effectuer des opérations de gestion de fichiers avec des volumes à l'aide de plusieurs interfaces et outils :
-
Upload, download, et parcourez les fichiers dans Catalog Explorer. Consultez Qu'est-ce que l'Explorateur de catalogue ?.
- Pour upload des fichiers locaux vers un volume, consultez Travailler avec des fichiers dans les volumes Unity Catalog.
- Pour download des fichiers d'internet dans un volume, consultez Download de données d'internet.
- Pour stocker vos propres fichiers sans d’abord créer de catalogue, de schéma et de volume, utilisez Mes fichiers, un volume par utilisateur. Mes fichiers est en bêta. Consultez Stocker les fichiers dans Mes fichiers.
-
Lisez et écrivez des données par programmation à l’aide d’Apache Spark, de pandas ou de SQL. Consultez Travailler par programmation avec des fichiers dans des volumes.
-
Gérez les fichiers à l'aide de
dbutils.fs, de commandes magiques ou de commandes shell bash. Consultez les commandes utilitaires pour les fichiers dans les volumes.
Vous pouvez utiliser des volumes avec des fonctionnalités Databricks qui nécessitent un chemin de système de fichiers. Les volumes vous offrent un chemin gouverné qui fonctionne de manière cohérente pour les utilisateurs et les Workspace. Par exemple :
-
Ingestion des données : utilisez les volumes comme emplacement source pour l'ingestion de données. start à partir de fichiers dans un volume et les ingérer dans des tables en utilisant :
COPY INTO: Chargez des fichiers d'un volume dans une table à l'aide de SQL. ConsultezCOPY INTO.- Auto Loader : ingérez de nouveaux fichiers qui arrivent dans un répertoire de volume dans une table de manière incrémentielle. Consultez Qu'est-ce qu'Auto Loader ?.
- Spark read APIs: Utilisez les Spark read APIs (par exemple,
spark.read.load) pour charger des fichiers à partir d'un chemin de volume dans un DataFrame et les écrire dans une table. Voir Travailler par programme avec des fichiers dans des volumes. - Interface utilisateur Databricks : créez une table directement à partir de fichiers stockés dans un volume. Consultez Créer une table à partir de données dans un volume.
-
Livraison des logs de compute : configurez la livraison des logs de compute pour écrire les logs dans un chemin de volume, afin que l'accès aux logs soit régi par Unity Catalog. Voir la livraison des logs de compute.
-
File arrival Triggers: Use file arrival Triggers to start Lakeflow Jobs when new files arrive in a volume. Consultez Trigger des jobs lorsque de nouveaux fichiers arrivent.
-
Bibliothèques de clusters : Installez les bibliothèques de clusters à partir d'un volume (fichiers JAR, roues,
requirements.txt), afin que l'accès à la bibliothèque soit régi par Unity Catalog. Consultez Installer les bibliothèques à partir d'un volume. -
Scripts d'initialisation : Stockez et exécutez les scripts d'initialisation à l'échelle du cluster à partir d'un volume, afin que l'accès aux scripts d'initialisation soit régi par Unity Catalog. Voir les scripts d'initialisation à l'échelle du cluster.
-
Artefacts d'Experimentation ML : stockez les artefacts d'Experimentation ML (modèles, métriques et fichiers de sortie) dans un volume afin que l'accès à vos sorties d'Experimentation MLflow soit régi par Unity Catalog. Consultez Organiser les exécutions d'entraînement avec les Experiments MLflow.