Aller au contenu principal

Configurer le stockage AWS (hérité)

important

Cette documentation a été retirée et pourrait ne pas être mise à jour. Les produits, services ou technologies mentionnés dans ce contenu ne sont plus pris en charge. Pour consulter la documentation administrative actuelle, consultez Gérez votre compte Databricks.

remarque

Cet article s'applique uniquement aux titulaires de comptes existants. Tous les nouveaux comptes Databricks et la plupart des comptes existants devraient utiliser Créer une configuration de stockage.

Databricks stocke les assets à l'échelle de votre compte, tels que les bibliothèques, dans un compartiment S3 Amazon Web Services. Cet article vous guide à travers les étapes de configuration de votre bucket pour finaliser le déploiement Databricks.

important

Vous pouvez configurer les paramètres de stockage AWS à l'aide de la console de compte uniquement lors de la configuration initiale de votre compte. Pour modifier les paramètres par la suite, contactez help@databricks.com.

Étape 1 : générer une politique de compartiment S3

Pour configurer le stockage AWS pour un compte hérité :

  1. Dans la console de compte Databricks, cliquez sur l'onglet AWS Storage .

    AWS storage tab

  2. Dans le champ compartiment S3 dans <region> , saisissez le nom de votre compartiment S3. Pour obtenir de l'aide pour créer un compartiment S3, consultez Créer un compartiment dans la documentation AWS.

important
  • Le compartiment S3 doit se trouver dans la même région que le déploiement Databricks.
  • Databricks recommande comme meilleure pratique d’utiliser un compartiment S3 spécifique à Databricks.
  • Ne réutilisez pas un compartiment à partir d'anciens Workspace. Par exemple, si vous migrez vers E2, créez un nouveau compartiment AWS pour votre configuration E2.
  1. Cliquez sur Générer la politique .

  2. Copiez la politique générée. Elle doit être sous la forme suivante, où 414351767826 est l'ID du compte Databricks et <s3-bucket-name> est le compartiment S3 que vous avez spécifié sur le premier écran :

    JSON
    {
    "Version": "2012-10-17",
    "Statement": [
    {
    "Sid": "Grant Databricks Access",
    "Effect": "Allow",
    "Principal": {
    "AWS": "arn:aws:iam::414351767826:root"
    },
    "Action": [
    "s3:GetObject",
    "s3:GetObjectVersion",
    "s3:PutObject",
    "s3:DeleteObject",
    "s3:ListBucket",
    "s3:GetBucketLocation"
    ],
    "Resource": ["arn:aws:s3:::<s3-bucket-name>/*", "arn:aws:s3:::<s3-bucket-name>"]
    }
    ]
    }

Étape 2 : Configurez le compartiment S3

Pour configurer le compartiment S3, appliquez la politique de compartiment générée dans la console de compte Databricks et configurez éventuellement la journalisation au niveau objet S3 (fortement recommandé).

  1. Dans la console AWS, rendez-vous au service S3.
  2. Cliquez sur le nom du compartiment.

Appliquer la politique de compartiment

  1. Cliquez sur l'onglet tab .

  2. Cliquez sur le bouton Politique relative aux compartiments.

    Bouton de stratégie de compartiment

  3. Collez la politique que vous avez copiée à l'Étape 1 et cliquez sur Enregistrer .

Activer la journalisation au niveau des objets S3 (recommandé)

Databricks recommande vivement d'activer la journalisation au niveau de l'objet S3 pour votre compartiment de stockage racine. Cela permet une investigation plus rapide de tout problème qui pourrait survenir. Sachez que la journalisation au niveau de l'objet S3 peut augmenter les coûts d'utilisation d'AWS.

Pour obtenir des instructions, consultez la documentation AWS sur la journalisation des événements CloudTrail pour les compartiments et objets S3.

Étape 3 : Appliquer la modification à votre compte Databricks

  1. Dans la console de compte Databricks, rendez-vous à l'onglet **AWS Storage tab**.
  2. Cliquez sur Appliquer la modification .

Résoudre les échecs de validation

Les autorisations de politique de bucket peuvent prendre quelques minutes à se propager. Vous devez réessayer si la validation échoue en raison des autorisations.