Default storage in Databricks
Cette page explique le fonctionnement du stockage default sur Databricks et comment créer des catalogues et des objets de données qui l’utilisent.
Qu'est-ce que le default stockage ?
Le stockage default est une plateforme de stockage d'objets entièrement managé qui fournit un stockage prêt à l'emploi dans votre compte Databricks. Certaines fonctionnalités de Databricks utilisent le stockage default comme alternative au stockage externe.
Les workspaces Serverless utilisent le stockage default pour le stockage interne et le stockage du Workspace, ainsi que pour le catalogue default créé avec le Workspace. Dans les workspaces serverless, vous pouvez créer des catalogues supplémentaires soit dans le stockage par default, soit dans votre propre stockage d'objets cloud.
Dans les Workspaces classiques et les Workspaces serverless, le stockage default est utilisé par les fonctionnalités pour stocker des éléments tels que les métadonnées du plan de contrôle, les données dérivées, les modèles et d'autres artefacts. Par exemple, les salles blanches, la classification des données, la détection d'anomalies, l' assistant de connaissances et la restauration automatisée des sessions pour les notebooks Serverless utilisent tous le stockage default d'un Workspace. Reportez-vous à la documentation de chaque fonctionnalité pour plus de détails sur ce que chaque fonctionnalité stocke dans le stockage default.
Pour des informations sur le monitoring des coûts de stockage default dans votre compte, consultez Surveiller les coûts de stockage default.
Exigences
- La création de catalogues sur le stockage default n’est disponible que dans les workspaces serverless.
- Par défaut, les catalogues qui utilisent le stockage par default ne sont accessibles que depuis le Workspace où ils sont créés. Vous pouvez accorder l’accès à d’autres Workspaces, y compris les Workspaces classiques, mais ils doivent utiliser un compute Serverless pour accéder aux données du catalogue. Voir la liaison Workspace-catalogue.
- Vous devez disposer des privilèges
CREATE CATALOGpour créer un catalogue avec un stockage default. Consultez la référence des privilèges Unity Catalog. - Si votre client utilise le driver ODBC Databricks pour accéder à un catalogue de stockage default derrière un pare-feu, vous devez configurer votre pare-feu pour autoriser l'accès aux passerelles de stockage régionales de Databricks. Pour les détails des adresses IP et des noms de domaine pour le stockage default, consultez Adresses IP et domaines pour les services et assets Databricks.
Créer un nouveau catalogue
Suivez les étapes suivantes pour créer un nouveau catalogue à l'aide du stockage default :
- Cliquez sur
Catalogue dans la barre latérale. L'Explorateur de catalogue apparaît.
- Cliquez sur Créer un catalogue . La boîte de dialogue Créer un nouveau catalogue s'affiche.
- Fournissez un **Nom de catalogue** qui est unique dans votre compte.
- Sélectionnez l'option Utiliser le stockage default .
- Cliquez sur Créer .
Dans les Workspaces Serverless, vous pouvez également utiliser la commande SQL suivante pour créer un nouveau catalogue dans votre stockage par default. Vous n'avez pas besoin de spécifier un emplacement pour le catalogue.
CREATE CATALOG [ IF NOT EXISTS ] catalog_name
[ COMMENT comment ]
Travailler avec le stockage default
Toutes les interactions avec le stockage default nécessitent un compute serverless compatible avec Unity Catalog.
Les Ressources soutenues par le stockage default utilisent le même modèle de privilèges que d'autres objets dans Unity Catalog. Vous devez disposer de privilèges suffisants pour créer, afficher, query ou modifier des objets de données. Consulter la référence des privilèges Unity Catalog.
Vous travaillez avec le stockage par default en créant et en interagissant avec des tables gérées et des volumes gérés reposant sur le stockage par default. Voir les tables gérées par Unity Catalog pour Delta Lake et Apache Iceberg et Que sont les volumes Unity Catalog ?.
Vous pouvez utiliser Catalog Explorer, les Notebooks, l'éditeur SQL et les tableaux de bord pour interagir avec les objets de données stockés dans le stockage default.
Exemples de tâches
Voici des exemples de tâches que vous pouvez effectuer avec le stockage default :
- upload des fichiers locaux vers un volume géré ou pour créer une table gérée. Consultez Travailler avec des fichiers dans les volumes Unity Catalog et Créer ou modifier une table à l'aide du fichier upload.
- query des données avec des Notebooks. Consultez Tutoriel : query et visualiser des données à partir d'un Notebook.
- Créez un tableau de bord. Consultez Créer un tableau de bord.
- Requêter les données avec SQL et planifier les requêtes SQL. Consultez Rédigez des query et explorez les données dans le nouvel éditeur SQL.
- Ingérez des données d'un volume externe vers une table gérée. Voir Utilisation d'Auto Loader avec Unity Catalog.
- Ingérer les données dans une table gérée avec Fivetran. Consultez Se connecter à Fivetran.
- Utilisez les outils de BI pour explorer les tables gérées. Consulter Connecter Tableau et Databricks et Power BI avec Databricks.
- Exécutez des Notebooks Serverless. Voir compute Serverless pour les notebooks.
- Exécutez des jobs serverless. Consultez Exécuter vos Lakeflow Jobs avec le compute serverless pour les workflows.
- Exécuter les Endpoint de service de modèle. Consultez Déployer des modèles à l'aide de Model Serving.
- Exécutez des Serverless LakeFlow Pipelines. Voir configurer un pipeline serverless.
- Utilisez l'optimisation prédictive sur vos tables. Consultez Optimisation prédictive pour les tables gérées par Unity Catalog.
Cycle de vie du stockage après la suppression d'un objet
Lorsque vous supprimez une table ou un volume géré qui utilise le stockage default, les fichiers de données sont conservés pour permettre une fenêtre de récupération de 7 jours. Une fois la période de récupération terminée, les fichiers de données sont définitivement supprimés (purgés) dans les 48 heures. La facturation du stockage continue pendant la fenêtre de récupération et s'arrête une fois que la fenêtre de récupération se termine. Pour plus de détails sur le cycle de vie des fichiers de données, la facturation et les options de récupération, consultez Cycle de vie du stockage d'objets dans Unity Catalog.
Limitations
Les limitations suivantes s'appliquent :
-
Le compute classique (tout compute qui n'est pas serverless) ne peut pas interagir avec les data assets dans le stockage default.
-
OpenSharing prend en charge le partage de tables avec n'importe quel destinataire — qu'il soit ouvert ou Databricks — et les destinataires peuvent utiliser le compute classique pour accéder aux tables partagées (Aperçu public). Activez la fonctionnalité **OpenSharing pour le stockage Default – Accès étendu** dans la console du compte.
- Tous les autres assets partageables ne peuvent être openshared qu'avec des destinataires Databricks sur le même cloud. Les destinataires doivent utiliser le compute serverless.
-
Les tables avec partitionnement activé ne peuvent pas être partagées ouvertement.
-
Les clients externes Iceberg et Delta ne peuvent pas accéder directement aux métadonnées sous-jacentes, à la liste de manifestes et aux fichiers de données pour les tables UC sur le stockage default (l’accès FileIO n’est pas pris en charge). Cependant, les outils de BI tels que Power BI et Tableau peuvent accéder aux tables Unity Catalog sur le stockage default à l'aide de drivers ODBC et JDBC. Les clients externes peuvent également accéder aux volumes Unity Catalog sur le stockage default à l'aide de l'API Files.
-
Le stockage par default prend en charge l'accès externe via les drivers ODBC et JDBC Databricks, y compris l'optimisation des performances Cloud Fetch du driver ODBC pour les requêtes sur des datasets plus volumineux. Cependant, si vous accédez à une table de stockage default depuis un Workspace où Private Link frontal est activé, vos requêtes client ODBC qui renvoient des résultats supérieurs à environ 5 MiB échoueront car l'optimisation Cloud Fetch pour les tables de stockage default ne prend pas actuellement en charge Private Link frontal.
-
La fourniture d'identifiants n'est pas prise en charge, par exemple lorsque des systèmes externes se connectent à l'API REST Unity ou au catalogue REST Iceberg. Consultez l'approvisionnement d'identifiants du Unity Catalog pour l'accès aux systèmes externes.