Aller au contenu principal

Clés gérées par le client pour le chiffrement

remarque

Cette fonctionnalité nécessite le niveau Enterprise.

Cette page fournit une vue d'ensemble des clés gérées par le client pour le chiffrement. Certains services et données prennent en charge l’ajout d’une clé gérée par le client afin d’aider à protéger les données chiffrées et à en contrôler l’accès. Vous pouvez utiliser le service de gestion de clés de votre cloud pour maintenir une clé de chiffrement gérée par le client.

Pour savoir comment configurer les clés, consultez Configurer les clés gérées par le client pour le chiffrement.

Cas d’utilisation des clés gérées par le client

Databricks propose deux cas d'utilisation de clés gérées par les clients qui impliquent différents types de données et d'emplacements :

  • Services gérés : Données dans le plan de contrôle Databricks, y compris les notebooks, les secrets, les données de requêtes SQL et les données stockées dans le stockage par default.
  • **Stockage du workspace** : Votre compartiment de stockage du workspace (qui contient la racine DBFS) et les volumes EBS des ressources de compute dans le plan de compute classique. Ne s’applique pas au stockage default.

Unity Catalog prend également en charge la possibilité de lire et d'écrire dans des compartiments S3 avec le chiffrement KMS activé. Consultez Créer un identifiant de stockage qui accède à un compartiment S3 AWS

remarque

Pour les workspaces serverless, vous n'avez qu'à configurer les clés pour les services gérés, ce qui s'applique au stockage du workspace et au stockage racine.

Clés gérées par le client pour les services gérés

Les données des services gérés dans le plan de contrôle Databricks sont chiffrées au repos. Vous pouvez ajouter une clé gérée par le client pour les services gérés afin de protéger et de contrôler l’accès aux types de données chiffrées suivants :

remarque

La configuration de clés gérées par le client pour les services gérés entraîne l'affichage de champs vides dans la table système de l'historique des query du metastore, tels que statement_text, tant que vous n'avez pas également configuré la CMK du catalogue système. Les administrateurs de compte peuvent configurer les paramètres de chiffrement des données du catalogue system pour rendre ces champs disponibles. Voir Lecture des champs chiffrés.

Pour configurer les clés gérées par le client pour les services gérés, consultez Configurer les clés gérées par le client pour le chiffrement.

remarque

Seuls les tableaux de bord AI/BI créés après le 1er novembre 2024 sont chiffrés et compatibles avec les clés gérées par les clients.

Clés gérées par les clients pour le stockage du Workspace

Vous pouvez ajouter une clé gérée par le client pour le stockage du workspace afin de protéger et de contrôler l'accès aux types de données chiffrées suivants :

  • Votre bucket de stockage du workspace : si vous ajoutez une clé de chiffrement du stockage du workspace, Databricks chiffre les données sur le bucket Amazon S3 de votre compte AWS que vous avez spécifié lors de la configuration de votre workspace, lequel est appelé bucket de stockage du workspace. Ce compartiment contient la racine DBFS, qui inclut la zone FileStore, les modèles MLflow et les données LakeFlow Pipelines dans votre racine DBFS (pas les montages DBFS). Le compartiment inclut également les données système du Workspace, qui comprennent les résultats de Job, les résultats Databricks SQL, les révisions de Notebook et d'autres données du Workspace. Pour plus d'informations, consultez Créer une configuration de stockage.
  • Volumes EBS de votre cluster (facultatif) : Pour les nœuds de cluster Databricks Runtime et d’autres ressources compute dans le plan de calcul classique, vous pouvez éventuellement utiliser la clé pour chiffrer les volumes EBS distants de la machine virtuelle.
remarque

Cette fonctionnalité affecte votre racine DBFS mais n'est pas utilisée pour chiffrer les données sur les montages DBFS supplémentaires. Pour les montages DBFS S3, vous pouvez utiliser d’autres approches pour l’écriture de données chiffrées avec vos clés. Pour plus d’informations, consultez la page Chiffrer les données dans les compartiments S3. Les montages sont un modèle d'accès hérité. Databricks recommande d’utiliser Unity Catalog pour gérer tous les accès aux données. Consultez la page Connexion au stockage d’objets cloud à l’aide d’Unity Catalog.

Comparez les cas d'utilisation des clés gérées par le client

Le tableau suivant répertorie les fonctionnalités de clé gérées par le client utilisées pour quels types de données.

remarque

Les cas d'utilisation du chiffrement peuvent varier en fonction du type de Workspace. Workspace Serverless utilise uniquement le cas d'utilisation des services gérés.

Type de données

Emplacement

Quelle fonctionnalité de clé gérée par le client utiliser

Tableaux de bord AI/BI

Plan de contrôle

Services gérés

Source et métadonnées du Notebook

Plan de contrôle

Services gérés

Jetons d'accès personnels (PAT) ou autres identifiants utilisés pour l'intégration Git avec les dossiers Git Databricks

Plan de contrôle

Services gérés

Secrets stockés par les APIs du gestionnaire de secrets

Plan de contrôle

Services gérés

Databricks SQL requêtes et historique de requêtes

Plan de contrôle

Services gérés

Index et métadonnées de recherche AI

Plan de compute Serverless

Services gérés

Données du projet Lakebase Autoscaling

Plan de contrôle

Services gérés

Les volumes EBS distants pour les nœuds de cluster Databricks Runtime et d'autres Ressources de compute.

Workspaces classiques : Plan de compute classique dans votre compte AWS
Workspaces Serverless : Non applicable (le stockage est éphémère sur le compute serverless)

**Workspaces classiques :** stockage du workspace
Workspaces Serverless : non applicable

Données de stockage racine

Workspaces classiques : racine DBFS dans votre compartiment de stockage de Workspace dans votre compte AWS. Cela inclut également la zone FileStore.
Workspaces Serverless : le stockage par default du Workspace

**Workspaces classiques :** stockage du workspace
**Workspaces Serverless** : services gérés

Job results

Workspaces classiques : compartiment de stockage Workspace dans votre compte AWS
Workspaces Serverless : le stockage par default du Workspace

**Workspaces classiques :** stockage du workspace
**Workspaces Serverless** : services gérés

Résultats de la query Databricks SQL

Workspaces classiques : compartiment de stockage Workspace dans votre compte AWS
Workspaces Serverless : le stockage par default du Workspace

**Workspaces classiques :** stockage du workspace
**Workspaces Serverless** : services gérés

MLflow Models

Workspaces classiques : compartiment de stockage Workspace dans votre compte AWS
Workspaces Serverless : le stockage par default du Workspace

**Workspaces classiques :** stockage du workspace
**Workspaces Serverless** : services gérés

LakeFlow Pipelines

Workspaces classiques : si vous utilisez un chemin DBFS dans votre racine DBFS, il est stocké dans le compartiment de stockage du Workspace de votre compte AWS. Ceci ne s'applique pas aux chemins DBFS qui représentent des points de montage vers d'autres sources de données.
Workspaces Serverless : le stockage par default du Workspace

**Workspaces classiques :** stockage du workspace
**Workspaces Serverless** : services gérés

Résultats des Notebooks interactifs

Workspaces classiques : Par default, lorsque vous exécutez un notebook de manière interactive (plutôt que comme un Job), les résultats sont stockés dans le plan de contrôle pour les performances, certains résultats volumineux étant stockés dans votre bucket de stockage de Workspace dans votre compte AWS. Vous pouvez choisir de configurer Databricks pour stocker tous les résultats du notebook interactif dans votre compte AWS.
Workspaces Serverless : le stockage par default du Workspace

Workspaces classiques : Pour les résultats partiels dans le plan de contrôle, utilisez une clé gérée par le client pour les services gérés. Pour les résultats dans le compartiment de stockage du Workspace, que vous pouvez configurer pour tout stockage de résultats, utilisez une clé gérée par le client pour le stockage du Workspace.
**Workspaces Serverless** : services gérés

Images conteneurs de Model Serving et artefacts de modèle

Plan de contrôle

Services gérés

Type de données

Emplacement

Quelle fonctionnalité de clé gérée par le client utiliser

Tableaux de bord AI/BI

Plan de contrôle

Services gérés

Source et métadonnées du Notebook

Plan de contrôle

Services gérés

Jetons d'accès personnels (PAT) ou autres identifiants utilisés pour l'intégration Git avec les dossiers Git Databricks

Plan de contrôle

Services gérés

Secrets stockés par les APIs du gestionnaire de secrets

Plan de contrôle

Services gérés

Databricks SQL requêtes et historique de requêtes

Plan de contrôle

Services gérés

Index et métadonnées de recherche AI

Plan de compute Serverless

Services gérés

Données du projet Lakebase Autoscaling

Plan de contrôle

Services gérés

Les volumes EBS distants pour les nœuds de cluster Databricks Runtime et d'autres Ressources de compute.

Workspaces classiques : Plan de compute classique dans votre compte AWS
Workspaces Serverless : Non applicable (le stockage est éphémère sur le compute serverless)

**Workspaces classiques :** stockage du workspace
Workspaces Serverless : non applicable

Données de stockage racine

Workspaces classiques : racine DBFS dans votre compartiment de stockage de Workspace dans votre compte AWS. Cela inclut également la zone FileStore.
Workspaces Serverless : le stockage par default du Workspace

**Workspaces classiques :** stockage du workspace
**Workspaces Serverless** : services gérés

Job results

Workspaces classiques : compartiment de stockage Workspace dans votre compte AWS
Workspaces Serverless : le stockage par default du Workspace

**Workspaces classiques :** stockage du workspace
**Workspaces Serverless** : services gérés

Résultats de la query Databricks SQL

Workspaces classiques : compartiment de stockage Workspace dans votre compte AWS
Workspaces Serverless : le stockage par default du Workspace

**Workspaces classiques :** stockage du workspace
**Workspaces Serverless** : services gérés

MLflow Models

Workspaces classiques : compartiment de stockage Workspace dans votre compte AWS
Workspaces Serverless : le stockage par default du Workspace

**Workspaces classiques :** stockage du workspace
**Workspaces Serverless** : services gérés

LakeFlow Pipelines

Workspaces classiques : si vous utilisez un chemin DBFS dans votre racine DBFS, il est stocké dans le compartiment de stockage du Workspace de votre compte AWS. Ceci ne s'applique pas aux chemins DBFS qui représentent des points de montage vers d'autres sources de données.
Workspaces Serverless : le stockage par default du Workspace

**Workspaces classiques :** stockage du workspace
**Workspaces Serverless** : services gérés

Résultats des Notebooks interactifs

Workspaces classiques : Par default, lorsque vous exécutez un notebook de manière interactive (plutôt que comme un Job), les résultats sont stockés dans le plan de contrôle pour les performances, certains résultats volumineux étant stockés dans votre bucket de stockage de Workspace dans votre compte AWS. Vous pouvez choisir de configurer Databricks pour stocker tous les résultats du notebook interactif dans votre compte AWS.
Workspaces Serverless : le stockage par default du Workspace

Workspaces classiques : Pour les résultats partiels dans le plan de contrôle, utilisez une clé gérée par le client pour les services gérés. Pour les résultats dans le compartiment de stockage du Workspace, que vous pouvez configurer pour tout stockage de résultats, utilisez une clé gérée par le client pour le stockage du Workspace.
**Workspaces Serverless** : services gérés

Images conteneurs de Model Serving et artefacts de modèle

Plan de contrôle

Services gérés

Compute Serverless et clés gérées par les clients

Databricks SQL Serverless et compute serverless prennent en charge :

  • Clés pour les services gérés tels que les queries Databricks SQL, l'historique des queries, la source et les métadonnées des Notebooks, ainsi que les index et les métadonnées d'AI Search.
  • Clés de stockage du Workspace, y compris le stockage racine pour Databricks SQL et les résultats du Notebook.

Le chiffrement des volumes EBS distants ne s'applique pas au compute serverless, car les disques des ressources de compute serverless sont éphémères et liés au cycle de vie de la charge de travail serverless. Lorsque les ressources de compute Serverless sont arrêtées ou réduites, les machines virtuelles et leur stockage sont détruits.

Model Serving

Les ressources pour Model Serving, une fonctionnalité de compute serverless, se répartissent généralement en deux catégories :

  • Ressources que vous créez : les artefacts de modèle et les métadonnées de version sont stockés dans le stockage racine de votre Workspace. Model Serving et MLflow utilisent tous deux ce stockage. Vous pouvez configurer le chiffrement par clé gérée par le client pour ces données.
  • Ressources créées par Databricks : Les images conteneur et les artefacts de modèle sont stockés dans le registre géré par Databricks. Les clés gérées par le client pour les services gérés chiffrent ces données.