Objets de base de données dans Databricks
Databricks utilise deux objets sécurisables principaux pour stocker et accéder aux données.
- **Les tables** régissent l'accès aux données tabulaires.
- Les volumes régissent l'accès aux données non tabulaires.
Cet article décrit comment ces objets de base de données se rapportent aux catalogues, schémas, vues et autres objets de base de données dans Databricks. Cet article fournit également une introduction générale au fonctionnement des objets de base de données dans le contexte de l'architecture globale de la plateforme.
Que sont les objets de base de données dans Databricks ?
Les objets de base de données sont des entités qui vous aident à organiser, accéder et gouverner les données. Databricks utilise une hiérarchie à trois niveaux pour organiser les objets de base de données :
- Catalogue : Le conteneur de niveau supérieur, contient des schémas. Voir ce que sont les catalogues dans Databricks ?
- Schéma ou base de données : Contient des objets de données. Voir Que sont les schémas dans Databricks ?.
- Objets de données pouvant être contenus dans un schéma :
- Volume : un volume logique de données non tabulaires dans le stockage d'objets cloud. Consultez Que sont les volumes Unity Catalog ?.
- Table : une collection de données organisées par lignes et colonnes. Voir les tables Databricks.
- Vue : une query enregistrée sur une ou plusieurs tables. Consultez Qu’est-ce qu’une vue ?.
- Fonction : logique enregistrée qui renvoie une valeur scalaire ou un ensemble de lignes. Voir fonctions définies par l'utilisateur (UDFs) SQL et Python dans Unity Catalog.
- Modèle : un modèle de machine learning package avec MLflow. Consultez Gérer le cycle de vie des modèles dans Unity Catalog.

Les catalogues sont enregistrés dans un métastore qui est géré au niveau du compte. Seuls les administrateurs interagissent directement avec le métastore. Voir Metastore.
Databricks fournit des assets supplémentaires pour travailler avec les données, tous gouvernables à l'aide des contrôles d'accès au niveau du workspace ou d'Unity Catalog, la solution de gouvernance des données Databricks :
- Ressources de données au niveau du Workspace, telles que les notebooks, les Jobs et les queries.
- Objets sécurisables Unity Catalog tels que les informations d'identification de stockage et les partages OpenSharing, qui contrôlent principalement l'accès au stockage ou le partage sécurisé.
Pour plus d'informations, consultez Objets de base de données ou assets de données sécurisables du workspace et Identifiants et infrastructure sécurisables d'Unity Catalog.
Gestion de l'accès aux objets de base de données à l'aide d'Unity Catalog
Vous pouvez accorder et révoquer l'accès aux objets de base de données à tout niveau de la hiérarchie, y compris au metastore lui-même. L'accès à un objet accorde implicitement le même accès à tous les enfants de cet objet, sauf si l'accès est révoqué.
Vous pouvez utiliser les commandes SQL ANSI typiques pour accorder et révoquer l'accès aux objets dans Unity Catalog. Vous pouvez également utiliser l’Explorateur de catalogues pour la gestion des privilèges des objets de données axée sur l’interface utilisateur.
Pour plus d'informations sur la sécurisation des objets dans Unity Catalog, consultez Objets sécurisables dans Unity Catalog.
Autorisations d'objet par default dans Unity Catalog
Selon la manière dont votre workspace a été créé et activé pour Unity Catalog, vos utilisateurs peuvent avoir des autorisations par default sur les catalogues provisionnés automatiquement, y compris le catalogue main ou le catalogue de workspace (<workspace-name>). Pour plus d'informations, consultez les privilèges du catalogue de workspace.
Si votre workspace a été activé manuellement pour Unity Catalog, il inclut un schéma par default nommé default dans le catalogue main accessible à tous les utilisateurs de votre workspace. Si votre workspace a été activé automatiquement pour Unity Catalog et inclut un catalogue <workspace-name>, ce catalogue contient un schéma nommé default qui est accessible à tous les utilisateurs de votre workspace.
Objets de base de données vs. assets de données sécurisables du Workspace
Databricks vous permet de gérer plusieurs assets de Data Engineering, d'analytique, de ML et d'IA, aux côtés de vos objets de base de données. Vous n'enregistrez pas ces assets de données dans Unity Catalog. Au lieu de cela, ces assets sont gérés au niveau du Workspace, à l'aide de listes de contrôle pour régir les autorisations. Ces assets de données incluent les éléments suivants :
- Notebooks
- Tableaux de bord
- Jobs
- Pipelines
- Fichiers du workspace
- requêtes SQL
- Expériences
La plupart des actifs de données contiennent une logique qui interagit avec des objets de base de données pour query les données, utiliser des fonctions, enregistrer des modèles ou effectuer d'autres tâches courantes. Pour en savoir plus sur la sécurisation des assets de données du Workspace, consultez les listes de contrôle d'accès.
L'accès au compute est régi par des listes de contrôle d'accès. Vous configurez le compute avec un mode d’accès et pouvez ajouter des autorisations cloud supplémentaires, qui contrôlent la façon dont les utilisateurs peuvent accéder aux données. Databricks recommande d'utiliser des politiques de compute et de restreindre les privilèges de création de clusters comme bonne pratique de gouvernance des données. Voir Modes d'accès.
Informations d'identification sécurisables et infrastructure de Unity Catalog.
Unity Catalog gère l'accès au stockage d'objets cloud, au Data Sharing et à la fédération de query à l'aide d'objets sécurisables enregistrés au niveau du metastore. Voici de brèves descriptions de ces objets sécurisables non liés aux données.
Connexion d'Unity Catalog au stockage d'objets cloud
Vous devez définir des identifiants de stockage et des emplacements externes afin de créer un nouvel emplacement de stockage géré ou d'enregistrer des tables externes ou des volumes externes. Ces objets sécurisables sont enregistrés dans Unity Catalog :
- Identifiant de stockage : Un identifiant cloud à long terme qui fournit un accès au stockage cloud.
- Emplacement externe : une référence à un chemin de stockage d'objets cloud accessible à l'aide de l'identifiant de stockage associé.
Voir Se connecter au stockage d’objets cloud à l’aide de Unity Catalog.
OpenSharing
Databricks enregistre les objets sécurisables OpenSharing suivants dans Unity Catalog :
- Partage : Une collection en lecture seule de tables, de volumes et d'autres assets de données.
- Fournisseur : L'organisation ou l'entité qui partage des données. Dans le modèle de partage Databricks-to-Databricks, le fournisseur est enregistré dans le metastore Unity Catalog du destinataire en tant qu'entité unique identifiée par son ID de metastore.
- Destinataire : L’entité qui reçoit des partages d’un fournisseur. Dans le modèle de partage Databricks-to-Databricks, le destinataire est identifié auprès du fournisseur par son ID de metastore unique.
Consultez Qu'est-ce qu'OpenSharing ?.
Lakehouse Federation
Lakehouse Federation vous permet de créer des catalogues étrangers afin de fournir un accès en lecture seule aux données résidant dans d'autres systèmes tels que PostgreSQL, MySQL et Snowflake. Vous devez définir une connexion au système externe afin de créer des catalogues étrangers.
Connexion : un objet sécurisable Unity Catalog spécifie un chemin d'accès et des identifiants pour accéder à un système de base de données externe dans un scénario Lakehouse Federation.
Voir Connecter aux bases de données et catalogues externes.
Emplacements de stockage gérés pour les volumes et tables gérés
Lorsque vous créez des tables et des volumes dans Databricks, vous avez le choix de les rendre gérés ou externes . Unity Catalog gère l'accès aux tables et volumes externes à partir de Databricks, mais il ne contrôle pas les fichiers sous-jacents ni ne gère entièrement l'emplacement de stockage de ces fichiers. Les tables et volumes gérés, en revanche, sont entièrement managés par Unity Catalog et sont stockés dans un emplacement de stockage géré qui est associé au schéma conteneur. Consultez Spécifiez un emplacement de stockage géré dans Unity Catalog.
Databricks recommande les volumes gérés et les tables gérées pour la plupart des charges de travail, car ils simplifient la configuration, l’optimisation et la gouvernance.
Unity Catalog vs. Hive metastore
Databricks recommande d'utiliser Unity Catalog pour enregistrer et gouverner tous les objets de base de données, mais offre également une prise en charge héritée pour Hive metastore pour la gestion des schémas, tables, vues et fonctions.
Si vous interagissez avec des objets de base de données enregistrés à l'aide de Hive metastore, consultez Objets de base de données dans le Hive metastore hérité.