Configurer le stockage AWS (hérité)
Cette documentation a été retirée et pourrait ne pas être mise à jour. Les produits, services ou technologies mentionnés dans ce contenu ne sont plus pris en charge. Pour consulter la documentation administrative actuelle, consultez Gérez votre compte Databricks.
Cet article s'applique uniquement aux titulaires de comptes existants. Tous les nouveaux comptes Databricks et la plupart des comptes existants devraient utiliser Créer une configuration de stockage.
Databricks stocke les assets à l'échelle de votre compte, tels que les bibliothèques, dans un compartiment S3 Amazon Web Services. Cet article vous guide à travers les étapes de configuration de votre bucket pour finaliser le déploiement Databricks.
Vous pouvez configurer les paramètres de stockage AWS à l'aide de la console de compte uniquement lors de la configuration initiale de votre compte. Pour modifier les paramètres par la suite, contactez help@databricks.com.
Étape 1 : générer une politique de compartiment S3
Pour configurer le stockage AWS pour un compte hérité :
-
Dans la console de compte Databricks, cliquez sur l'onglet AWS Storage .

-
Dans le champ compartiment S3 dans <region> , saisissez le nom de votre compartiment S3. Pour obtenir de l'aide pour créer un compartiment S3, consultez Créer un compartiment dans la documentation AWS.
- Le compartiment S3 doit se trouver dans la même région que le déploiement Databricks.
- Databricks recommande comme meilleure pratique d’utiliser un compartiment S3 spécifique à Databricks.
- Ne réutilisez pas un compartiment à partir d'anciens Workspace. Par exemple, si vous migrez vers E2, créez un nouveau compartiment AWS pour votre configuration E2.
-
Cliquez sur Générer la politique .
-
Copiez la politique générée. Elle doit être sous la forme suivante, où
414351767826est l'ID du compte Databricks et<s3-bucket-name>est le compartiment S3 que vous avez spécifié sur le premier écran :JSON{
"Version": "2012-10-17",
"Statement": [
{
"Sid": "Grant Databricks Access",
"Effect": "Allow",
"Principal": {
"AWS": "arn:aws:iam::414351767826:root"
},
"Action": [
"s3:GetObject",
"s3:GetObjectVersion",
"s3:PutObject",
"s3:DeleteObject",
"s3:ListBucket",
"s3:GetBucketLocation"
],
"Resource": ["arn:aws:s3:::<s3-bucket-name>/*", "arn:aws:s3:::<s3-bucket-name>"]
}
]
}
Étape 2 : Configurez le compartiment S3
Pour configurer le compartiment S3, appliquez la politique de compartiment générée dans la console de compte Databricks et configurez éventuellement la journalisation au niveau objet S3 (fortement recommandé).
- Dans la console AWS, rendez-vous au service S3.
- Cliquez sur le nom du compartiment.
Appliquer la politique de compartiment
-
Cliquez sur l'onglet tab .
-
Cliquez sur le bouton Politique relative aux compartiments.

-
Collez la politique que vous avez copiée à l'Étape 1 et cliquez sur Enregistrer .
Activer la journalisation au niveau des objets S3 (recommandé)
Databricks recommande vivement d'activer la journalisation au niveau de l'objet S3 pour votre compartiment de stockage racine. Cela permet une investigation plus rapide de tout problème qui pourrait survenir. Sachez que la journalisation au niveau de l'objet S3 peut augmenter les coûts d'utilisation d'AWS.
Pour obtenir des instructions, consultez la documentation AWS sur la journalisation des événements CloudTrail pour les compartiments et objets S3.
Étape 3 : Appliquer la modification à votre compte Databricks
- Dans la console de compte Databricks, rendez-vous à l'onglet **AWS Storage tab**.
- Cliquez sur Appliquer la modification .
Résoudre les échecs de validation
Les autorisations de politique de bucket peuvent prendre quelques minutes à se propager. Vous devez réessayer si la validation échoue en raison des autorisations.