Objets de base de données dans SAP Databricks
SAP Databricks utilise deux objets sécurisables principaux pour stocker et accéder aux données.
- **Les tables** régissent l'accès aux données tabulaires.
- Les volumes régissent l'accès aux données non tabulaires.
Cet article décrit comment ces objets de base de données se rapportent aux catalogues, aux schémas, aux vues et à d'autres objets de base de données dans SAP Databricks. Cet article fournit également une introduction générale au fonctionnement des objets de base de données dans le contexte de l'architecture globale de la plateforme.
Que sont les objets de base de données dans SAP Databricks ?
Les objets de base de données sont des entités qui vous aident à organiser, accéder et gouverner les données. SAP Databricks utilise une hiérarchie à trois niveaux pour organiser les objets de base de données :
- Catalogue : Conteneur de niveau supérieur, contient des schémas.
- Schéma ou base de données : contient des objets de données.
- Objets de données pouvant être contenus dans un schéma :
- Volume : un volume logique de données non tabulaires dans le stockage d'objets cloud.
- Table : collection de données organisées par lignes et colonnes.
- Afficher : une query enregistrée sur une ou plusieurs tables.
- Fonction : logique enregistrée qui renvoie une valeur scalaire ou un ensemble de lignes.
- Modèle : un modèle de machine learning conditionné avec MLflow.
Les catalogues sont enregistrés dans un métastore géré au niveau du compte.
SAP Databricks fournit des assets supplémentaires pour travailler avec les données, tous gouvernables à l'aide de contrôles d'accès au niveau du workspace ou de Unity Catalog, la solution de gouvernance des données Databricks :
- Ressources de données au niveau du Workspace, telles que les notebooks, les Jobs et les queries.
- Objets sécurisables Unity Catalog tels que les informations d'identification de stockage et les partages OpenSharing, qui contrôlent principalement l'accès au stockage ou le partage sécurisé.
Gestion de l'accès aux objets de base de données à l'aide d'Unity Catalog
Vous pouvez accorder et révoquer l'accès aux objets de base de données à tout niveau de la hiérarchie, y compris au metastore lui-même. L'accès à un objet accorde implicitement le même accès à tous les enfants de cet objet, sauf si l'accès est révoqué.
Vous pouvez utiliser les commandes SQL ANSI typiques pour accorder et révoquer l'accès aux objets dans Unity Catalog. Vous pouvez également utiliser l’Explorateur de catalogues pour la gestion des privilèges des objets de données axée sur l’interface utilisateur.
Autorisations d'objet par default dans Unity Catalog
Les utilisateurs disposent d'autorisations par default sur les catalogues automatiquement provisionnés, y compris le catalogue Workspace (<workspace-name>). Ce catalogue contient un schéma nommé default qui est accessible à tous les utilisateurs du Workspace.
Objets de base de données vs. assets de données sécurisables du Workspace
SAP Databricks vous permet de gérer plusieurs assets de data engineering, d'analytique, de ML et d'IA en même temps que vos objets de base de données. Vous n'enregistrez pas ces assets de données dans Unity Catalog. Au lieu de cela, ces assets sont gérés au niveau du Workspace, à l'aide de listes de contrôle pour régir les autorisations. Ces assets de données incluent les éléments suivants :
- Notebooks
- Fichiers du workspace
- requêtes SQL
- Expériences
La plupart des assets de données contiennent une logique qui interagit avec des objets de base de données pour query des données, utiliser des fonctions, enregistrer des modèles ou d'autres tâches courantes.
Emplacements de stockage gérés pour les volumes et tables gérés
Lorsque vous créez des tables et des volumes dans SAP Databricks, vous avez le choix de les rendre gérées ou externes . Unity Catalog gère l'accès aux tables et volumes externes de SAP Databricks, mais ne contrôle pas les fichiers sous-jacents ni ne gère entièrement l'emplacement de stockage de ces fichiers. Les tables et volumes gérés, en revanche, sont entièrement gérés par Unity Catalog et sont stockés dans un emplacement de stockage géré associé au schéma contenant.
Databricks recommande les volumes gérés et les tables gérées pour la plupart des charges de travail, car ils simplifient la configuration, l’optimisation et la gouvernance.