Aller au contenu principal

Dépannage de la création de Workspaces

Présentation

Les sections suivantes décrivent les erreurs de configuration survenant lors de la création du Workspace et comment les corriger. La plupart des problèmes s'appliquent à la création de workspace à l'aide de la console du compte ou de l'API du compte, avec des exceptions comme indiqué.

Erreurs générales

Nombre maximal de VPC

Si vous recevez un message d'erreur mentionnant le nombre maximal de VPC, soumettez une demande d'augmentation de la limite de service pour le nombre de VPC autorisés dans la région. Cette erreur se produit généralement uniquement si vous utilisez un Virtual Private Cloud (VPC) géré par Databricks, et non un VPC géré par les clients.

Nombre maximal d'Endpoints VPC

Si vous recevez un message d'erreur mentionnant un nombre maximal d'Endpoint Virtual Private Cloud (VPC), soumettez une demande d'augmentation de limite de service pour le nombre d'Endpoint VPC de passerelle autorisés dans la région. Cette erreur se produit généralement uniquement si vous utilisez un Virtual Private Cloud (VPC) géré par Databricks, et non un VPC géré par les clients.

Nombre maximal d'adresses

Si vous recevez un message d'erreur mentionnant un nombre maximal d'adresses, soumettez une demande d'augmentation de la limite de service pour les adresses IP élastiques de Virtual Private Cloud (VPC) autorisées dans la région. Cette erreur se produit généralement uniquement si vous utilisez un Virtual Private Cloud (VPC) géré par Databricks, et non un VPC géré par les clients.

Non autorisé à effectuer cette opération

Si vous obtenez une erreur vous indiquant que vous n'êtes pas autorisé à effectuer cette opération, vérifiez que votre rôle IAM contient toutes les politiques nécessaires, telles que définies dans l'article sur le rôle IAM.

Messages d'erreur de configuration du stockage

Requête malformée : Échec des vérifications de validation de la configuration du stockage.

Si vous recevez un message d'erreur qui mentionne des échecs de vérification de validation de la configuration de stockage, vos autorisations de compartiment S3 ne sont pas correctement configurées. Suivez les étapes de l'article Créer une configuration de stockage pour vous assurer que les autorisations du compartiment S3 sont correctes.

Messages d'erreur de configuration des identifiants

Requête malformée : Échec des vérifications de validation de la configuration des identifiants

La liste des vérifications d'autorisations dans le message d'erreur indique la cause probable de vos problèmes.

  • Si la validation de la configuration des informations d'identification échoue moins de dix vérifications d'autorisations, il est probable que votre stratégie IAM ne dispose pas de ces autorisations spécifiques. Copiez la politique correcte depuis l'article Créer une configuration d'identifiant.
  • Si la validation de la configuration d'identifiant échoue lors de dix vérifications ou plus, il est plus probable que la relation de confiance du rôle IAM soit configurée de manière incorrecte. Vérifiez que la relation de confiance de votre rôle de client est configurée correctement, conformément aux instructions de l'article Créer une configuration d'identifiant.

Si votre politique et votre relation de confiance semblent toutes deux correctes : veuillez également vérifier les points suivants.

  • Confirmez que vous incluez le rôle ARN correct dans l'objet d'identification.
  • Confirmez si vous avez des stratégies de contrôle de service (SCPs) au niveau de l'organisation qui refusent l'action AssumeRole ou refusent l'accès EC2/Virtual Private Cloud (VPC). Si vous ne savez pas, demandez à votre administrateur AWS des informations sur les SCP.

Configuration réseau

Le sous-réseau est déjà utilisé par un autre réseau

Une erreur de sous-réseau en cours d’utilisation ressemble généralement à ceci :

MALFORMED_REQUEST: Malformed parameters: subnet_id subnet-xxxxxxxx1 is already used by another Network, subnet_id subnet-xxxxxxxx2 is already used by another Network.

Cela signifie que vous disposez d'une configuration réseau Databricks qui utilise ces mêmes sous-réseaux. Pour résoudre ce problème, effectuez l’une des opérations suivantes :

  • Supprimez la configuration précédente. Si vous utilisez l'API de compte, utilisez l'API de suppression de configuration réseau. Vous pouvez également utiliser la console du compte pour supprimer la configuration.
  • Si la configuration précédente n'est pas utilisée, vous pouvez l'utiliser pour votre nouveau Workspace.
  • Si cette configuration réseau est déjà utilisée par un Workspace en cours d'exécution, créez de nouveaux sous-réseaux et une nouvelle configuration réseau pour votre nouveau Workspace.

Notez que si une tentative précédente de création de Workspace a échoué, les composants de configuration associés ne sont pas automatiquement supprimés.

Aucune erreur de configuration réseau lors de la configuration, mais des erreurs apparaissent lors de la création du workspace

Une configuration réseau peut afficher des erreurs après une tentative de déploiement d'un workspace, mais n'a affiché aucune erreur lors de sa configuration. C'est parce que Databricks n'effectue que des validations de base lors de la création de l'objet réseau. Par exemple, il vérifie les sous-réseaux uniques, les groupes de sécurité uniques et les champs manquants.

La validation la plus significative de la configuration réseau n'a lieu qu'après avoir tenté de créer un nouveau workspace avec votre nouvelle configuration réseau. S'il y a eu des erreurs lors du déploiement du workspace, examinez attentivement le message d'erreur de validation réseau pour plus de détails.

Un Workspace semble fonctionner, mais sa configuration réseau a le statut WARNED

Assurez-vous de pouvoir start un cluster, d'exécuter un Job de données, et que vous n'avez pas DBFS_DOWN ou METASTORE_DOWN affiché dans vos Log d'événements du compute. S'il n'y a pas de telles erreurs dans le log des événements du cluster, le statut WARNED n'est pas nécessairement un problème.

Pour un nouveau workspace, Databricks tente de vérifier un certain nombre de choses. Si vous n'effectuez pas un routage simple tel que sous-réseaux du Workspace → NAT Gateway → Internet Gateway, alors Databricks ne peut pas vérifier que votre réseau est correct. Dans de tels cas, Databricks affiche un avertissement sur la configuration réseau.

Vérifier les erreurs de table de routage de sous-réseau

Dans votre log d’événements de clusters, vous pouvez voir des erreurs telles que :

subnet: Route Table with ID rtb-xxxxxxxx used for subnet with ID subnet-yyyyyyyyy is missing default route to direct all traffic to the NAT gateway nat-zzzzzzzzzzz.

Cette erreur pourrait en fait indiquer un problème si vous essayez de déployer une configuration simple de Workspace Databricks.

Si vous configurez votre propre sortie, comme le routage via un pare-feu (facultativement via une passerelle de transit en étoile), cette erreur ne sera pas nécessairement pertinente.

Une autre cause potentielle de cette erreur est que vous enregistrez un sous-réseau NAT en tant que sous-réseau Databricks pour les clusters. Supprimez le sous-réseau NAT de la liste des sous-réseaux du Workspace Databricks et recréez le Workspace.

N'ajoutez pas votre sous-réseau NAT à la liste des sous-réseaux dans une configuration réseau.

N'ajoutez pas votre sous-réseau NAT à la liste des sous-réseaux du Workspace Databricks. Le sous-réseau NAT est destiné à la passerelle NAT et n'est pas prévu comme sous-réseau pour le déploiement de nœuds de cluster Databricks. Lors de la création d'une configuration réseau, ne listez que les deux sous-réseaux à utiliser pour les nœuds Databricks.

Le groupe de sécurité n'a pas pu être mis à jour avec les dernières règles

Vous pouvez voir une erreur de log de cluster telle que :

Security Group with ID sg-xxxx could not be updated with latest Security Group Rules

Mettez à jour le rôle IAM pour qu'il soit conforme à ce que nous avons dans l'article sur les rôles IAM. Dans certains cas, la ressource pour AuthorizeSecurityGroupEgress et des actions similaires peut avoir des valeurs séparées par des virgules. Mettez à jour ceux-ci en ressources distinctes au lieu d'une seule ressource :

Correct

JSON
"Action": [
"ec2:AuthorizeSecurityGroupEgress",
"ec2:AuthorizeSecurityGroupIngress",
"ec2:RevokeSecurityGroupEgress",
"ec2:RevokeSecurityGroupIngress"
],
"Resource": [
"arn:aws:ec2:us-east-1:444:security-group/sg-xxxx",
"arn:aws:ec2:us-east-1:444:security-group/sg-yyyy",
"arn:aws:ec2:us-east-1:444:security-group/sg-zzzz"
],

Incorrect

JSON
"Resource": ["arn:aws:ec2:us-east-1:444:security-group/sg-xxxx,sg-yyyy,sg-zzzz"],

Si vous rencontrez des problèmes de configuration réseau, envisagez d'utiliser un VPC géré par Databricks

Si vous rencontrez des problèmes de configuration réseau, vous pourriez choisir de créer le Workspace avec un Virtual Private Cloud (VPC) géré par Databricks plutôt qu’un Virtual Private Cloud (VPC) géré par le client.

important

Vous devez choisir si vous souhaitez fournir un Virtual Private Cloud (VPC) géré par le client lors de la création de votre Workspace. Vous ne pouvez pas modifier ce paramètre après avoir créé le workspace avec succès.

Pour faire passer un Workspace en échec à l'utilisation d'un Virtual Private Cloud (VPC) géré par Databricks, vous devez également utiliser un autre rôle IAM inter-comptes :

  1. Accédez à l’article rôle IAM inter-comptes.
  2. Sélectionnez et copiez la politique intitulée **VPC Databricks**.
  3. Utilisez cette politique pour la création de Workspace à l'aide de la console de compte ou la création de Workspace à l'aide de l'API de compte
    • Dans la console de compte, dans le sélecteur de configuration réseau, sélectionnez géré par Databricks .

    • Pour l'API de compte, veillez à ne pas inclure l’élément network_id, par exemple :

      JSON
      {
      "workspace_name": "<workspace-name>",
      "deployment_name": "<deployment-name>",
      "aws_region": "<aws-region>",
      "credentials_id": "<credentials-id>",
      "storage_configuration_id": "<storage-configuration-id>"
      }

Diagnostiquer les problèmes de réseau Virtual Private Cloud (VPC) avec AWS Reachability Analyzer

Reachability Analyzer d'AWS est un outil d'analyse de configuration que vous pouvez utiliser pour tester une Ressource source et une Ressource de destination dans votre Virtual Private Cloud (VPC). Vous pouvez le trouver dans votre console AWS sous le nom de VPC Reachability Analyzer .

Avec Reachability Analyzer, vous pouvez lancer une machine de test dans le sous-réseau privé Databricks sans vous connecter. Vous devez ajouter la source en tant qu'instance EC2 et la destination en tant qu'adresse IP et port du plan de contrôle Databricks. Vous pouvez ensuite tester la connectivité pour trouver le composant bloquant. Pour plus d'information, consultez Qu'est-ce que Reachability Analyzer.

Messages d'erreur spécifiques à l'API du compte

Les erreurs suivantes peuvent être potentiellement retournées à partir d’une requête d’API de compte pour créer le workspace.

Requête mal formée : <config> non valide dans le corps de la requête HTTP

Le JSON de votre corps de requête est mal formaté. Dans ce message d'erreur, <config> fait référence aux identifiants, aux configurations de stockage ou aux réseaux. Vérifiez que tous les caractères spéciaux sont correctement échappés dans l'URL ou utilisez une application client REST API, telle que Postman.

Requête mal formée : <config> non valide dans le corps.

Le JSON de votre corps de requête est mal formaté. Dans ce message d'erreur, <config> fait référence aux identifiants, aux configurations de stockage ou aux réseaux. Vérifiez que tous les caractères spéciaux sont correctement échappés dans l'URL ou utilisez une application client REST API, telle que Postman.