Clés gérées par le client pour le chiffrement
Cette fonctionnalité nécessite le niveau Enterprise.
Cette page fournit une vue d'ensemble des clés gérées par le client pour le chiffrement. Certains services et données prennent en charge l’ajout d’une clé gérée par le client afin d’aider à protéger les données chiffrées et à en contrôler l’accès. Vous pouvez utiliser le service de gestion de clés de votre cloud pour maintenir une clé de chiffrement gérée par le client.
Pour savoir comment configurer les clés, consultez Configurer les clés gérées par le client pour le chiffrement.
Cas d’utilisation des clés gérées par le client
Databricks propose deux cas d'utilisation de clés gérées par les clients qui impliquent différents types de données et d'emplacements :
- Services gérés : données dans l'plan de contrôle Databricks (les notebooks, les secrets et les données de requêtes Databricks SQL).
- Stockage du workspace : Les deux compartiments de stockage du workspace et les volumes de disque persistant GCE des ressources de compute.
Clés gérées par le client pour les services gérés
Les données des services gérés dans le plan de contrôle Databricks sont chiffrées au repos. Vous pouvez ajouter une clé gérée par le client pour les services gérés afin de protéger et de contrôler l’accès aux types de données chiffrées suivants :
- Source du Notebook dans le plan de contrôle de Databricks.
- Résultats du Notebook pour les Notebooks exécutés de manière interactive (pas en tant que Jobs) qui sont stockés dans le plan de contrôle. Par default, les résultats plus volumineux sont également stockés dans le compartiment racine de votre workspace. Vous pouvez configurer Databricks pour stocker tous les résultats de Notebook interactifs dans votre compte cloud.
- Secrets stockés dans les secrets Databricks.
- Tableaux de bord AI/BI.
- Databricks SQL requêtes et historique des requêtes.
- Jetons d'accès personnel (PAT) ou autres identifiants utilisés pour configurer l'intégration Git avec les dossiers Git Databricks.
- Index de recherche AI et métadonnées.
- Pour les Workspaces Serverless, le cas d’utilisation des services gérés s’applique également au stockage du Workspace et au stockage racine, ce qui inclut les résultats des Jobs, les résultats Databricks SQL, les révisions de notebooks et d’autres données du Workspace.
Pour configurer les clés gérées par le client pour les services gérés, consultez Configurer les clés gérées par le client pour le chiffrement.
Seuls les tableaux de bord AI/BI créés après le 1er novembre 2024 sont chiffrés et compatibles avec les clés gérées par les clients.
Clés gérées par les clients pour le stockage du Workspace
Vous pouvez ajouter une clé gérée par le client pour le stockage du workspace afin de protéger et de contrôler l'accès aux types de données chiffrées suivants :
- Vos compartiments de stockage de Workspace : Si vous ajoutez une clé de chiffrement de stockage de Workspace, Databricks chiffre les données sur les deux compartiments GCS associés au projet Google Cloud que Databricks a créé lorsque vous avez créé votre Workspace. Il s'agit des compartiments de stockage du Workspace. Un compartiment contient la racine DBFS, qui comprend la zone FileStore, les Modèles MLflow et les données de Lakeflow Pipelines dans votre racine DBFS (et non les montages DBFS). Un autre compartiment contient les données système du Workspace, notamment les résultats de Job, les résultats Databricks SQL, les révisions de Notebook et d'autres données du Workspace.
- Disques persistants GCE de votre cluster : Votre clé de chiffrement de stockage de Workspace est utilisée pour chiffrer les disques persistants GCE des nœuds de cluster Databricks Runtime et d'autres ressources de compute dans le plan de compute classique.
Comparez les cas d'utilisation des clés gérées par le client
Le tableau suivant répertorie les fonctionnalités de clé gérées par le client utilisées pour quels types de données.
Type de données | Emplacement | Quelle fonctionnalité de clé gérée par le client utiliser |
|---|---|---|
Tableaux de bord AI/BI | Plan de contrôle | Services gérés |
Source et métadonnées du Notebook | Plan de contrôle | Services gérés |
Jetons d'accès personnels (PAT) ou autres identifiants utilisés pour l'intégration Git avec les dossiers Git Databricks | Plan de contrôle | Services gérés |
Secrets stockés par les APIs du gestionnaire de secrets | Plan de contrôle | Services gérés |
Databricks SQL requêtes et historique de requêtes | Plan de contrôle | Services gérés |
Les volumes de disque persistant GCE distants pour les nœuds de cluster Databricks Runtime et d'autres ressources de compute. | Stockage du Workspace | |
La racine DBFS dans le compartiment de stockage de votre workspace. Cela inclut également la zone FileStore. | Stockage du Workspace | |
Job results | Compartiments de stockage Workspace dans votre compte Google Cloud | Stockage du Workspace |
Résultats de la query Databricks SQL | Compartiments de stockage Workspace dans votre compte Google Cloud | Stockage du Workspace |
Compartiments de stockage Workspace dans votre compte Google Cloud | Stockage du Workspace | |
Si vous utilisez un chemin DBFS dans votre racine DBFS, ceci est stocké dans les compartiments de stockage du Workspace de votre compte Google Cloud. Cela ne s'applique pas aux chemins DBFS qui représentent des points de montage vers d'autres sources de données. | Stockage du Workspace | |
By default, lorsque vous exécutez un Notebook de manière interactive (plutôt que comme un Job), les résultats sont stockés dans le plan de contrôle pour la performance, et certains résultats volumineux sont stockés dans le bucket de stockage de votre Workspace dans votre compte Google Cloud. Vous pouvez choisir de configurer Databricks pour stocker tous les résultats des notebooks interactifs dans votre compte Google Cloud. Consultez Configurer l’emplacement de stockage des résultats de notebook interactifs. | Pour les résultats partiels dans le plan de contrôle, utilisez une clé gérée par le client pour les services gérés. Pour les résultats dans les deux buckets GCS, que vous pouvez configurer pour tout le stockage des résultats, utilisez une clé gérée par le client pour le stockage du workspace. Consultez Configurer l’emplacement de stockage des résultats de notebook interactifs. | |
Plan de contrôle | Services gérés |
Compute Serverless et clés gérées par les clients
Databricks SQL Serverless et compute serverless prennent en charge :
- Clés pour les services gérés tels que les queries Databricks SQL, l'historique des queries, la source et les métadonnées des Notebooks, ainsi que les index et les métadonnées d'AI Search.
- Clés de stockage du Workspace, y compris le stockage racine pour Databricks SQL et les résultats du Notebook.
Le chiffrement des volumes de disque persistant GCE distants ne s'applique pas au compute serverless, car les disques des ressources de compute serverless sont éphémères et liés au cycle de vie de la charge de travail serverless. Lorsque les ressources de compute Serverless sont arrêtées ou réduites, les machines virtuelles et leur stockage sont détruits.
Model Serving
Les ressources pour Model Serving, une fonctionnalité de compute serverless, se répartissent généralement en deux catégories :
- Ressources que vous créez : les artefacts de modèle et les métadonnées de version sont stockés dans le stockage racine de votre Workspace. Model Serving et MLflow utilisent tous deux ce stockage. Vous pouvez configurer le chiffrement par clé gérée par le client pour ces données.
- Ressources créées par Databricks : Les images conteneur et les artefacts de modèle sont stockés dans le registre géré par Databricks. Les clés gérées par le client pour les services gérés chiffrent ces données.