Configurer l'accès aux données pour l'ingestion
Cet article explique comment les utilisateurs administrateurs peuvent configurer l'accès aux données dans un compartiment Amazon S3 (S3) afin que les utilisateurs Databricks puissent charger des données de S3 dans une table Databricks.
Cet article décrit les méthodes suivantes pour configurer un accès sécurisé aux données sources :
-
(Recommandé) Créez un volume Unity Catalog.
-
Créer un emplacement externe Unity Catalog avec un identifiant de stockage.
-
Lancez une ressource de compute qui utilise un profil d'instance AWS.
-
Générez des identifiants temporaires (un ID de clé d'accès AWS, une clé secrète et un jeton de session).
Avant de commencer
Avant de configurer l'accès aux données dans S3, assurez-vous de disposer des éléments suivants :
-
Données dans un compartiment S3 de votre compte AWS. Pour créer un compartiment, consultez Création d'un compartiment dans la documentation AWS.
-
Pour accéder aux données à l'aide d'un volume Unity Catalog (recommandé), le privilège
READ VOLUMEsur le volume. Pour plus d'informations, consultez Qu'est-ce que les volumes Unity Catalog ? et Référence des privilèges Unity Catalog. -
Pour accéder aux données à l'aide d'un emplacement externe Unity Catalog, le privilège
READ FILESsur l'emplacement externe. Pour plus d'informations, consultez Accorder les autorisations sur un emplacement externe. -
Pour accéder aux données en utilisant une ressource de compute avec un profil d'instance AWS, des autorisations d'administrateur du Workspace Databricks sont nécessaires.
-
Un SQL Warehouse Databricks. Pour créer un SQL Warehouse, consultez Créer un SQL Warehouse.
-
Familiarité avec l'interface utilisateur de Databricks SQL.
Configurer l'accès au stockage cloud
Utilisez l'une des méthodes suivantes pour configurer l'accès à S3 :
-
(Recommandé) Créez un volume Unity Catalog. Pour plus d'informations, consultez Que sont les volumes Unity Catalog ?.
-
Configurez un emplacement externe Unity Catalog avec un identifiant de stockage. Pour plus d'informations sur les emplacements externes, consultez la vue d'ensemble des emplacements externes.
-
Configurer une ressource de compute pour utiliser un profil d'instance AWS. Pour plus d'informations, consultez Configurer les SQL Warehouse et le compute Serverless pour utiliser un profil d'instance.
-
Générez des informations d’identification temporaires (un ID de clé d’accès AWS, une clé secrète et un jeton de session) à partager avec d’autres utilisateurs de Databricks. Pour plus d’informations, consultez Générer des informations d’identification temporaires pour l’ingestion.
Nettoyer
Vous pouvez nettoyer les Ressources associées dans votre compte cloud et Databricks si vous ne souhaitez plus les conserver.
Supprimer le profil nommé de l'AWS CLI
Dans votre fichier ~/.aws/credentials pour Unix, Linux et macOS, ou dans votre fichier %USERPROFILE%\.aws\credentials pour Windows, supprimez la portion suivante du fichier, puis enregistrez le fichier :
[<named-profile>]
aws_access_key_id = <access-key-id>
aws_secret_access_key = <secret-access-key>
Supprimer l'utilisateur IAM
- Ouvrez la console IAM dans votre compte AWS, généralement à l'adresse https://console.aws.amazon.com/iam.
- Dans la barre latérale, cliquez sur Utilisateurs .
- Sélectionnez la case à côté de l'utilisateur, puis cliquez sur Supprimer .
- Saisissez le nom de l'utilisateur, puis cliquez sur Supprimer .
Supprimer la politique IAM
- Ouvrez la console IAM dans votre compte AWS, si elle n'est pas déjà ouverte, généralement à l'adresse https://console.aws.amazon.com/iam.
- Dans la barre latérale, cliquez sur Politiques .
- Sélectionnez l'option à côté de la politique, puis cliquez sur Actions > Supprimer .
- Saisissez le nom de la politique, puis cliquez sur Supprimer .
Supprimer le compartiment S3
- Ouvrez la console Amazon S3 dans votre compte AWS, généralement à l'adresse https://console.aws.amazon.com/s3.
- Sélectionnez l'option située à côté du compartiment, puis cliquez sur Vider .
permanently deleteEntrez, puis cliquez sur **Vide**.- Dans la barre latérale, cliquez sur Buckets .
- Sélectionnez l’option à côté du compartiment, puis cliquez sur Supprimer .
- Entrez le nom du compartiment, puis cliquez sur Supprimer le compartiment .
Arrêter le SQL warehouse
Si vous n'utilisez pas le SQL Warehouse pour d'autres tâches, vous devriez arrêter le SQL Warehouse afin d'éviter des coûts supplémentaires.
- Dans l'interface **SQL**, dans la barre latérale, cliquez sur **SQL Warehouses**.
- À côté du nom du SQL Warehouse, cliquez sur **Arrêter**.
- Lorsque vous y êtes invité, cliquez à nouveau sur Arrêter .
Étapes suivantes
Une fois que vous avez terminé les étapes de cet article, les utilisateurs peuvent exécuter la commande COPY INTO pour charger les données du compartiment S3 dans votre Workspace Databricks.
-
Pour charger des données à l'aide d'un volume ou d'un emplacement externe Unity Catalog, consultez Charger des données à l'aide de COPY INTO avec des volumes ou des emplacements externes Unity Catalog.
-
Pour charger des données à l'aide d'un SQL Warehouse avec un profil d'instance AWS, consultez Charger des données à l'aide de COPY INTO avec un profil d'instance.
-
Pour charger des données à l’aide d’identifiants temporaires (un identifiant de clé d’accès AWS, une clé secrète et un jeton de session), consultez Charger des données à l’aide de COPY INTO avec des identifiants temporaires.