Clés gérées par le client pour le chiffrement
Cette fonctionnalité nécessite le niveau Enterprise.
Cette page fournit une vue d'ensemble des clés gérées par le client pour le chiffrement. Certains services et données prennent en charge l’ajout d’une clé gérée par le client afin d’aider à protéger les données chiffrées et à en contrôler l’accès. Vous pouvez utiliser le service de gestion de clés de votre cloud pour maintenir une clé de chiffrement gérée par le client.
Pour savoir comment configurer les clés, consultez Configurer les clés gérées par le client pour le chiffrement.
Cas d’utilisation des clés gérées par le client
Databricks propose deux cas d'utilisation de clés gérées par les clients qui impliquent différents types de données et d'emplacements :
- Services gérés : Données dans le plan de contrôle Databricks, y compris les notebooks, les secrets, les données de requêtes SQL et les données stockées dans le stockage par default.
- **Stockage du workspace** : Votre compartiment de stockage du workspace (qui contient la racine DBFS) et les volumes EBS des ressources de compute dans le plan de compute classique. Ne s’applique pas au stockage default.
Unity Catalog prend également en charge la possibilité de lire et d'écrire dans des compartiments S3 avec le chiffrement KMS activé. Consultez Créer un identifiant de stockage qui accède à un compartiment S3 AWS
Pour les workspaces serverless, vous n'avez qu'à configurer les clés pour les services gérés, ce qui s'applique au stockage du workspace et au stockage racine.
Clés gérées par le client pour les services gérés
Les données des services gérés dans le plan de contrôle Databricks sont chiffrées au repos. Vous pouvez ajouter une clé gérée par le client pour les services gérés afin de protéger et de contrôler l’accès aux types de données chiffrées suivants :
- Source du Notebook dans le plan de contrôle de Databricks.
- Résultats du Notebook pour les Notebooks exécutés de manière interactive (pas en tant que Jobs) qui sont stockés dans le plan de contrôle. Par default, les résultats plus volumineux sont également stockés dans le compartiment racine de votre workspace. Vous pouvez configurer Databricks pour stocker tous les résultats de Notebook interactifs dans votre compte cloud.
- Secrets stockés dans les secrets Databricks.
- Tableaux de bord AI/BI.
- Agents Genie.
- Databricks SQL requêtes et historique des requêtes.
- Jetons d'accès personnel (PAT) ou autres identifiants utilisés pour configurer l'intégration Git avec les dossiers Git Databricks.
- Index de recherche AI et métadonnées.
- Dimensionnement automatique Lakebase des données de projet au repos.
- Pour les Workspaces Serverless, le cas d’utilisation des services gérés s’applique également au stockage du Workspace et au stockage racine, ce qui inclut les résultats des Jobs, les résultats Databricks SQL, les révisions de notebooks et d’autres données du Workspace.
La configuration de clés gérées par le client pour les services gérés entraîne l'affichage de champs vides dans la table système de l'historique des query du metastore, tels que statement_text, tant que vous n'avez pas également configuré la CMK du catalogue système. Les administrateurs de compte peuvent configurer les paramètres de chiffrement des données du catalogue system pour rendre ces champs disponibles. Voir Lecture des champs chiffrés.
Pour configurer les clés gérées par le client pour les services gérés, consultez Configurer les clés gérées par le client pour le chiffrement.
Seuls les tableaux de bord AI/BI créés après le 1er novembre 2024 sont chiffrés et compatibles avec les clés gérées par les clients.
Clés gérées par les clients pour le stockage du Workspace
Vous pouvez ajouter une clé gérée par le client pour le stockage du workspace afin de protéger et de contrôler l'accès aux types de données chiffrées suivants :
- Votre bucket de stockage du workspace : si vous ajoutez une clé de chiffrement du stockage du workspace, Databricks chiffre les données sur le bucket Amazon S3 de votre compte AWS que vous avez spécifié lors de la configuration de votre workspace, lequel est appelé bucket de stockage du workspace. Ce compartiment contient la racine DBFS, qui inclut la zone FileStore, les modèles MLflow et les données LakeFlow Pipelines dans votre racine DBFS (pas les montages DBFS). Le compartiment inclut également les données système du Workspace, qui comprennent les résultats de Job, les résultats Databricks SQL, les révisions de Notebook et d'autres données du Workspace. Pour plus d'informations, consultez Créer une configuration de stockage.
- Volumes EBS de votre cluster (facultatif) : Pour les nœuds de cluster Databricks Runtime et d’autres ressources compute dans le plan de calcul classique, vous pouvez éventuellement utiliser la clé pour chiffrer les volumes EBS distants de la machine virtuelle.
Cette fonctionnalité affecte votre racine DBFS mais n'est pas utilisée pour chiffrer les données sur les montages DBFS supplémentaires. Pour les montages DBFS S3, vous pouvez utiliser d’autres approches pour l’écriture de données chiffrées avec vos clés. Pour plus d’informations, consultez la page Chiffrer les données dans les compartiments S3. Les montages sont un modèle d'accès hérité. Databricks recommande d’utiliser Unity Catalog pour gérer tous les accès aux données. Consultez la page Connexion au stockage d’objets cloud à l’aide d’Unity Catalog.
Comparez les cas d'utilisation des clés gérées par le client
Le tableau suivant répertorie les fonctionnalités de clé gérées par le client utilisées pour quels types de données.
Les cas d'utilisation du chiffrement peuvent varier en fonction du type de Workspace. Workspace Serverless utilise uniquement le cas d'utilisation des services gérés.
Type de données | Emplacement | Quelle fonctionnalité de clé gérée par le client utiliser |
|---|---|---|
Tableaux de bord AI/BI | Plan de contrôle | Services gérés |
Source et métadonnées du Notebook | Plan de contrôle | Services gérés |
Jetons d'accès personnels (PAT) ou autres identifiants utilisés pour l'intégration Git avec les dossiers Git Databricks | Plan de contrôle | Services gérés |
Secrets stockés par les APIs du gestionnaire de secrets | Plan de contrôle | Services gérés |
Databricks SQL requêtes et historique de requêtes | Plan de contrôle | Services gérés |
Plan de compute Serverless | Services gérés | |
Données du projet Lakebase Autoscaling | Plan de contrôle | Services gérés |
Les volumes EBS distants pour les nœuds de cluster Databricks Runtime et d'autres Ressources de compute. | Workspaces classiques : Plan de compute classique dans votre compte AWS | **Workspaces classiques :** stockage du workspace |
Workspaces classiques : racine DBFS dans votre compartiment de stockage de Workspace dans votre compte AWS. Cela inclut également la zone FileStore. | **Workspaces classiques :** stockage du workspace | |
Job results | Workspaces classiques : compartiment de stockage Workspace dans votre compte AWS | **Workspaces classiques :** stockage du workspace |
Résultats de la query Databricks SQL | Workspaces classiques : compartiment de stockage Workspace dans votre compte AWS | **Workspaces classiques :** stockage du workspace |
Workspaces classiques : compartiment de stockage Workspace dans votre compte AWS | **Workspaces classiques :** stockage du workspace | |
Workspaces classiques : si vous utilisez un chemin DBFS dans votre racine DBFS, il est stocké dans le compartiment de stockage du Workspace de votre compte AWS. Ceci ne s'applique pas aux chemins DBFS qui représentent des points de montage vers d'autres sources de données. | **Workspaces classiques :** stockage du workspace | |
Workspaces classiques : Par default, lorsque vous exécutez un notebook de manière interactive (plutôt que comme un Job), les résultats sont stockés dans le plan de contrôle pour les performances, certains résultats volumineux étant stockés dans votre bucket de stockage de Workspace dans votre compte AWS. Vous pouvez choisir de configurer Databricks pour stocker tous les résultats du notebook interactif dans votre compte AWS. | Workspaces classiques : Pour les résultats partiels dans le plan de contrôle, utilisez une clé gérée par le client pour les services gérés. Pour les résultats dans le compartiment de stockage du Workspace, que vous pouvez configurer pour tout stockage de résultats, utilisez une clé gérée par le client pour le stockage du Workspace. | |
Plan de contrôle | Services gérés |
Compute Serverless et clés gérées par les clients
Databricks SQL Serverless et compute serverless prennent en charge :
- Clés pour les services gérés tels que les queries Databricks SQL, l'historique des queries, la source et les métadonnées des Notebooks, ainsi que les index et les métadonnées d'AI Search.
- Clés de stockage du Workspace, y compris le stockage racine pour Databricks SQL et les résultats du Notebook.
Le chiffrement des volumes EBS distants ne s'applique pas au compute serverless, car les disques des ressources de compute serverless sont éphémères et liés au cycle de vie de la charge de travail serverless. Lorsque les ressources de compute Serverless sont arrêtées ou réduites, les machines virtuelles et leur stockage sont détruits.
Model Serving
Les ressources pour Model Serving, une fonctionnalité de compute serverless, se répartissent généralement en deux catégories :
- Ressources que vous créez : les artefacts de modèle et les métadonnées de version sont stockés dans le stockage racine de votre Workspace. Model Serving et MLflow utilisent tous deux ce stockage. Vous pouvez configurer le chiffrement par clé gérée par le client pour ces données.
- Ressources créées par Databricks : Les images conteneur et les artefacts de modèle sont stockés dans le registre géré par Databricks. Les clés gérées par le client pour les services gérés chiffrent ces données.