Aller au contenu principal

Codes d'erreur d'arrêt du compute classique

Cet article fournit des conseils de dépannage pour les codes d’erreur courants de terminaison de cluster. Utilisez le code d’erreur de votre log d’événements du cluster pour trouver la cause pertinente et le correctif recommandé.

AWS_INSUFFICIENT_FREE_ADDRESSES_IN_SUBNET_FAILURE

Le sous-réseau AWS ne dispose pas d'adresses IP libres suffisantes pour lancer les instances demandées.

Exemple de message d'erreur

Not enough free addresses in subnet subnet-[REDACTED] (Service: AmazonEC2; Status Code: 400; Error Code: InvalidParameterValue; Request ID: [REDACTED]; Proxy: null)

Étapes de dépannage

  1. Vérifiez la plage CIDR du sous-réseau et les adresses IP disponibles dans la console AWS.
  2. Examiner le nombre d'instances actuellement en cours d'exécution dans le sous-réseau.
  3. Vérifiez la présence d'interfaces réseau élastiques inutilisées qui pourraient consommer des adresses IP.
  4. Vérifier s'il existe des réservations d'adresses IP dans le sous-réseau.

Correction recommandée

Mettez à jour votre cluster pour utiliser une zone de disponibilité différente avec suffisamment d'adresses IP, utilisez le paramètre de zone de disponibilité auto, étendez la plage CIDR du sous-réseau, ou nettoyez les ressources réseau inutilisées. Si le problème persiste, veuillez contacter l'assistance Databricks.

AWS_INSUFFICIENT_INSTANCE_CAPACITY_FAILURE

AWS ne dispose pas d'une capacité suffisante pour le type d'instance demandé dans la zone de disponibilité sélectionnée.

Exemples de messages d'erreur

We currently do not have sufficient c4.8xlarge capacity in the Availability Zone you requested (us-east-1d). Our system will be working on provisioning additional capacity. You can currently get c4.8xlarge capacity by not specifying an Availability Zone in your request or choosing us-east-1a, us-east-1b, us-east-1c, us-east-1e, us-east-1f.
There is no Spot capacity available that matches your request. (Service: AmazonEC2; Status Code: 500; Error Code: InsufficientInstanceCapacity; Request ID: [REDACTED]; Proxy: null)

Étapes de dépannage

  1. Vérifiez le type d'instance et la zone de disponibilité dans la configuration de votre cluster.
  2. Vérifiez si le problème affecte uniquement les instances ponctuelles ou s'il affecte également les instances à la demande.
  3. Consulter le tableau de bord d'état des services AWS pour les problèmes de capacité connus.
  4. Testez avec différents types d'instances de la même famille.

Correction recommandée

Essayez de lancer dans une zone de disponibilité différente, utilisez le paramètre de zone de disponibilité auto, passez à un type d’instance différent ou utilisez des instances à la demande au lieu d’instances ponctuelles. Pour les problèmes de capacité persistants, contactez le support AWS.

Pour réduire les erreurs de rupture de stock futures, demandez à votre administrateur de Workspace d'activer les types de nœuds flexibles afin que Databricks revienne automatiquement à des types d'instances compatibles lorsque votre type préféré n'est pas disponible. Les types de nœuds flexibles ne sont pas disponibles pour les types d'instances GPU.

AWS_RESOURCE_QUOTA_EXCEEDED

Le lancement du cluster dépasserait le quota du compte AWS pour le type de ressource demandé.

Étapes de dépannage

  1. Consultez la console de quotas de service AWS pour connaître les limites et l'utilisation actuelles.
  2. Identifiez le quota spécifique dépassé (instances, volumes, IP, etc.).
  3. Examinez l'utilisation des ressources sur toutes les régions.
  4. Vérifiez la présence de Ressources qui peuvent être nettoyées.

Correction recommandée

Demandez une augmentation de quota via la console AWS Service Quotas, nettoyez les ressources inutilisées, répartissez les charges de travail entre les régions ou utilisez différents types d'instances. Contactez le support AWS pour les demandes d’augmentation de quota.

BOOTSTRAP_TIMEOUT_DUE_TO_MISCONFIG

Le processus de démarrage de la VM a expiré en raison de problèmes de connectivité réseau, de téléchargements d'artefacts lents ou de problèmes avec le fournisseur cloud. Le délai d'expiration de démarrage est de 700 secondes.

Exemple de message d'erreur

[id: InstanceId([REDACTED]), status: INSTANCE_INITIALIZING, ...] with threshold 700 seconds timed out after 703891 milliseconds. Instance bootstrap inferred timeout reason: UnknownReason

Étapes de dépannage

  1. Vérifiez la connectivité au stockage d’artefacts Databricks.
  2. Vérifier la connectivité au plan de contrôle Databricks.
  3. Vérifiez la résolution DNS des Endpoints Databricks.
  4. Vérifier les règles de pare-feu et de groupe de sécurité.
  5. Vérifiez si le problème est constant ou intermittent.

Correction recommandée

Assurez-vous de la connectivité réseau au stockage Databricks et au plan de contrôle. Configurez des points de terminaison de service ou des points de terminaison Virtual Private Cloud (VPC) pour de meilleures performances réseau. Examinez la configuration du pare-feu, du DNS et du routage. Contactez l'assistance Databricks si la configuration réseau est vérifiée, mais que les délais d'expiration persistent.

CLOUD_OPERATION_CANCELLED

Le cluster a été arrêté car une opération de fournisseur cloud sous-jacente a été annulée avant la fin du lancement de l'instance.

Exemple de message d'erreur

Cluster terminated because an underlying cloud operation was cancelled. GCP Error: GCE Operation failed: Operation was canceled by user ''.

Étapes de dépannage

  1. Vérifiez les logs d'événements du cluster pour les codes d'erreur et les messages du fournisseur de cloud.
  2. Vérifiez si une opération concurrente ou une automatisation a annulé la ressource cloud.
  3. Vérifiez les Logs d'activité du fournisseur cloud pour les opérations annulées.
  4. Vérifiez si le problème est transitoire ou reproductible.

Correction recommandée

Réessayez le lancement du cluster. Si l'annulation a été causée par une automatisation externe ou une intervention manuelle, résolvez l'opération conflictuelle avant de réessayer. Contactez d'abord le support de votre fournisseur cloud si le problème persiste sans cause identifiable. Contactez l'assistance Databricks si le fournisseur cloud ne peut pas identifier la cause.

CLOUD_PROVIDER_RESOURCE_STOCKOUT_DUE_TO_MISCONFIG

Le fournisseur de services cloud n'a pas pu allouer les ressources de VM demandées en raison de contraintes de configuration de cluster, telles que le type d'instance, la zone de disponibilité ou les paramètres de placement.

Exemple de message d'erreur

The VM launch failed due to restrictive constraint. To reduce future stockout errors, enable flexible node types if not already enabled so Databricks can automatically fall back to alternative instance types.

Étapes de dépannage

  1. Examinez le type d'instance du cluster et la configuration de la zone de disponibilité.
  2. Vérifiez si les types de nœuds flexibles ou le fallback automatique sont activés.
  3. Vérifiez que le type d'instance demandé est disponible dans la zone sélectionnée.
  4. Consultez les logs d'événements des clusters pour les détails relatifs aux contraintes ou au placement.

Correction recommandée

Activez les types de nœuds flexibles, essayez une zone de disponibilité différente ou sélectionnez d'autres types d'instances. Mettez à jour les stratégies de compute ou les listes d’autorisation de types d’instances afin d’inclure des options de fallback. Veuillez contacter l’assistance Databricks si les modifications de configuration ne résolvent pas l’indisponibilité.

ÉCHEC_DE_LANCEMENT_DU_FOURNISSEUR_CLOUD

Le cloud provider n'a pas réussi à lancer l'instance de VM demandée. Il s'agit généralement d'un problème côté fournisseur cloud.

Exemple de message d'erreur

Reason: CLOUD_PROVIDER_LAUNCH_FAILURE (CLOUD_FAILURE). Parameters: databricks_error_message:VM launch failed because AWS returned internal error. [details] Server.InternalError: Internal error on launch(OnDemand), instance_id:[REDACTED], aws_api_error_code:Server.InternalError

Étapes de dépannage

  1. Vérifiez le aws_error_message dans les paramètres d'erreur pour la défaillance spécifique du fournisseur de services cloud.

  2. Consultez la page d'état du fournisseur cloud pour les incidents en cours dans votre région.

  3. Vérifiez les limites de quota et la capacité du sous-réseau si l’erreur les mentionne.

Correction recommandée

Veuillez réessayer ultérieurement, car la plupart des échecs de lancement des fournisseurs de cloud sont transitoires. Si le problème persiste, contactez le support de votre fournisseur cloud en lui transmettant l'erreur détaillée spécifique des détails.

COMMUNICATION_LOST

Le cluster a été arrêté car le plan de contrôle a perdu la communication avec l’instance. Ceci peut être causé par un état d'instance inattendu, une résiliation d'instance ou des problèmes au niveau du réseau où le plan de contrôle ne peut pas « pinger » l'instance pendant une période prolongée.

Exemple de message d'erreur

Cluster '[REDACTED]' was terminated. Reason: COMMUNICATION_LOST (CLOUD_FAILURE). Parameters: instance_id:[REDACTED], databricks_error_message:Node health check failed.

Étapes de dépannage

  1. Vérifiez la configuration réseau entre le plan de compute Databricks et l'Endpoint de relais SCC. S'il existe un pare-feu ou un proxy entre eux, il pourrait bloquer la communication de contrôle d'intégrité. Consultez votre administrateur réseau.
  2. Vérifiez l'utilisation du CPU et de la mémoire du nœud sur les métriques du cluster. Si les ressources sont épuisées, l'instance peut ne pas répondre au contrôle de santé. Envisagez d'utiliser un type d'instance plus grand.
  3. Vérifiez auprès de votre fournisseur cloud si l'instance a été arrêtée ou altérée en externe (par exemple, la mise hors service d'instances AWS, la maintenance d'hôtes Azure).
  4. Examinez les logs du Driver et de l'Executor Spark pour les erreurs qui auraient pu rendre l'instance non réactive (par exemple, des pauses OOM ou GC longues).

Correction recommandée

Vérifiez les paramètres du pare-feu et du proxy avec votre administrateur réseau. Si l'erreur a été causée par le fournisseur cloud qui a mis fin à l'instance, veuillez réessayer plus tard. Si cela a été causé par l'épuisement des ressources, envisagez de mettre à niveau vers un type d'instance plus grand. Si le problème persiste, contactez l'assistance Databricks.

CONTROL_PLANE_REQUEST_FAILURE/CONTROL_PLANE_REQUEST_FAILURE_DUE_TO_MISCONFIG

Le processus d'amorçage de la VM a échoué car l'instance n'a pas pu atteindre le plan de contrôle Databricks pour récupérer les étapes d'amorçage. Les deux codes d'erreur partagent la même défaillance sous-jacente et les mêmes conseils de dépannage. CONTROL_PLANE_REQUEST_FAILURE_DUE_TO_MISCONFIG est généralement signalé lorsque le Workspace présente un historique de défaillances de connectivité similaires au niveau du plan de contrôle.

Exemples de messages d'erreur

Failed to get instance bootstrap steps from the Databricks Control Plane. Please check that instances have connectivity to the Databricks Control Plane.
Network health check reported that instance is unable to reach Databricks Control Plane. Please check that instances have connectivity to the Databricks Control Plane. Instance bootstrap inferred timeout reason: NetworkHealthCheck_CP_Failed

Étapes de dépannage

  1. Décoder tous les messages d'erreur encodés en Base64 dans les Logs des événements du cluster.
  2. Vérifiez les paramètres DNS dans votre configuration réseau.
  3. Examinez les règles de pare-feu et les paramètres de sécurité réseau.
  4. Testez la connectivité du plan de contrôle à partir d'une VM dans le même réseau.
  5. Vérifiez que les serveurs DNS personnalisés sont fonctionnels et accessibles.

Correction recommandée

Vérifiez la configuration du serveur DNS et l'accessibilité. Assurez-vous que les règles de pare-feu autorisent le trafic sortant vers le plan de contrôle Databricks.

Veuillez contacter l'assistance Databricks si la configuration réseau semble correcte, mais que le problème persiste.

DOCKER_CONTAINER_CREATION_EXCEPTION

Le cluster n'a pas réussi à créer le conteneur Docker sur l'instance en raison d'une erreur de configuration du conteneur.

Exemple de message d'erreur

Failed to launch container due to an error while creating the container. Please revisit your container setup

Étapes de dépannage

  1. Vérifiez la configuration de l'image Docker personnalisée et les paramètres du point d'entrée.
  2. Vérifiez si le conteneur nécessite des privilèges root ou des fonctionnalités non prises en charge.
  3. Consultez les Logs d'événements du cluster pour les erreurs détaillées de création de conteneur.

Correction recommandée

Corrigez la configuration du conteneur Docker en fonction du message d'erreur. Assurez-vous que l'image respecte les exigences de Databricks pour les conteneurs personnalisés.

Pour obtenir des conseils sur la création d'une image de conteneur personnalisée, consultez Databricks Container Services pour le compute dédié ou Databricks Container Services pour le compute standard.

Veuillez relancer le cluster après la mise à jour de l'image ou de la configuration. Contactez le support Databricks si la configuration du conteneur semble correcte.

DOCKER_IMAGE_PULL_FAILURE

Le cluster n’a pas pu download l’image Docker à partir du registre de conteneurs en raison de problèmes de réseau, d’authentification ou de configuration.

Exemple de message d'erreur

Failed to pull docker image: authentication required

Étapes de dépannage

  1. Vérifiez que le nom et l'étiquette de l'image Docker sont corrects dans la configuration du cluster.
  2. Vérifiez la connectivité réseau au registre de conteneurs depuis le Workspace.
  3. Tester l'accès au registre à partir d'une VM dans le même réseau.
  4. Vérifiez les informations d’identification d’authentification pour les registres privés.
  5. Examinez les logs du démon du nœud pour obtenir des messages d'erreur détaillés.

Correction recommandée

Corrigez la configuration de l'image Docker et vérifiez les identifiants d'authentification. Assurez-vous que les règles réseau autorisent l'accès au registre de conteneurs.

Pour AWS ECR, configurez les Endpoint Virtual Private Cloud (VPC) pour éviter d'acheminer les downloads d'artefacts via l'Internet public.

Veuillez contacter l'assistance Databricks si la configuration semble correcte, mais que le problème persiste.

DOCKER_IMAGE_TOO_LARGE_FOR_INSTANCE_EXCEPTION

La taille de l'image Docker dépasse l'espace disque disponible sur le type d'instance sélectionné.

Exemple de message d'erreur

Failed to launch container as the docker image is too large for the instance.

Étapes de dépannage

  1. Vérifiez la taille de l'image Docker.
  2. Vérifiez la capacité de disque du type d'instance.
  3. Identifiez les couches ou fichiers inutiles dans l'image Docker.
  4. Vérifiez si plusieurs images volumineuses sont utilisées.

Correction recommandée

Utilisez un type d'instance avec une capacité de disque plus importante, optimisez l'image Docker en supprimant les fichiers et couches inutiles, utilisez des builds multi-étapes pour réduire la taille de l'image, ou divisez les fonctionnalités entre plusieurs images plus petites. Contactez le support Databricks pour obtenir de l'aide concernant l'optimisation des images.

DOCKER_INVALID_OS_EXCEPTION

Le conteneur Docker personnalisé utilise un système d'exploitation non pris en charge par le compute Databricks.

Exemple de message d'erreur

Failed to launch container due to an invalid Docker OS. Please revisit your OS configuration.

Étapes de dépannage

  1. Vérifiez le système d'exploitation de base dans l'image Docker personnalisée.
  2. Consultez la documentation Databricks pour les systèmes d'exploitation de conteneur pris en charge.
  3. Vérifiez la configuration de l'image Docker du cluster pour la référence d'image correcte.

Correction recommandée

Reconstruire l'image Docker à l'aide d'une image de base de système d'exploitation prise en charge. Databricks recommande d'utiliser une image de base Databricks. Ubuntu et Alpine Linux sont également pris en charge.

Pour obtenir des conseils sur la création d'une image de conteneur personnalisée, consultez Databricks Container Services pour le compute dédié ou Databricks Container Services pour le compute standard.

Mettez à jour la configuration du cluster avec l'image corrigée et réessayez le lancement. Contactez le support Databricks si le système d’exploitation doit être pris en charge.

EOS_SPARK_IMAGE

La version de Databricks Runtime (DBR) configurée pour le cluster a atteint la fin du support (EOS).

Exemple de message d'erreur

Spark image release__11.0.x-snapshot-cpu-ml-scala2.12__databricks-universe__head__[REDACTED]__format-2 does not exist with exit code 2

Étapes de dépannage

  1. Vérifiez la version DBR dans la configuration du cluster.
  2. Consultez les notes de version de Databricks Runtime pour les dates de fin de support.
  3. Identifier les versions DBR actuellement prises en charge.
  4. Vérifiez si les Notebooks ou les Jobs ont des dépendances de version DBR.

Correction recommandée

Mettez à jour la configuration du cluster pour utiliser une version prise en charge de Databricks Runtime. Veuillez vérifier les exigences de compatibilité pour les bibliothèques et le code avant de déployer en production. Contactez le support Databricks si vous avez besoin d'aide pour la migration DBR.

INSTANCE_POOL_MAX_CAPACITY_REACHED

Le pool d'instances a atteint la limite de capacité maximale configurée et ne peut pas fournir d'instances supplémentaires.

Exemple de message d'erreur

Instance pool is full, please consider increasing the pool size

Étapes de dépannage

  1. Vérifiez la configuration du Pool d'instances pour le paramètre de capacité maximale.
  2. Vérifiez le nombre d'instances actuellement utilisées du Pool.
  3. Identifiez les clusters qui utilisent le pool.
  4. Vérifiez s’il existe des instances inactives qui peuvent être libérées.

Correction recommandée

Augmentez la capacité maximale du pool d'instances, créez des pools d'instances supplémentaires pour répartir la charge, mettez fin aux clusters inactifs utilisant le pool ou configurez les clusters pour utiliser des pools différents. Examinez le dimensionnement du pool en fonction des exigences de la charge de travail concurrente.

INSTANCE_POOL_NOT_FOUND

Le cluster fait référence à un pool d'instances qui n'existe pas ou n'est plus actif.

Exemple de message d'erreur

Instances could not be provisioned for the cluster since the instance pool is no longer active

Étapes de dépannage

  1. Vérifiez l'ID du Pool d'instances dans la configuration du cluster.
  2. Vérifiez si le pool d'instances a été supprimé ou désactivé.
  3. Vérifiez les configurations de clusters et de Job pour les références de Pool d'instances obsolètes.
  4. Confirmez que le pool d'instances existe dans le même Workspace que le cluster.

Correction recommandée

Mettez à jour la configuration du cluster pour utiliser un pool d'instances existant, ou supprimez la référence au pool d'instances pour lancer des instances directement. Recréez le pool d'instances si nécessaire. Contactez l'assistance Databricks si le pool d'instances devrait exister mais ne peut pas être trouvé.

INSTANCE_UNREACHABLE / INSTANCE_UNREACHABLE_DUE_TO_MISCONFIG

Les instances sont injoignables en raison d’une mauvaise configuration du réseau, de règles de pare-feu ou de problèmes de connectivité. Les deux codes d'erreur partagent la même défaillance sous-jacente et les mêmes conseils de dépannage. INSTANCE_UNREACHABLE_DUE_TO_MISCONFIG est généralement signalé lorsque le workspace présente un historique d’échecs de connectivité similaires.

Exemple de message d'erreur

Bootstrap completes in the VM but control plane failed to reach the node. Please review your network configuration or firewall settings to allow Databricks to reach the node.

Étapes de dépannage

  1. Examiner les règles de pare-feu et les paramètres de sécurité réseau pour les ports entrants requis.
  2. Testez la connectivité du plan de contrôle au réseau d'instances.
  3. Rechercher les problèmes de routage asymétrique.
  4. Examinez les logs du pare-feu pour les connexions interrompues.
  5. Veuillez vérifier que les instances ont les bonnes attributions de groupes de sécurité.

Correction recommandée

Assurez-vous que les groupes de sécurité ou les NSG autorisent le trafic entrant requis depuis le plan de contrôle Databricks. Vérifiez que les tables de routage permettent une communication bidirectionnelle. Contactez le support Databricks pour obtenir de l'aide concernant le dépannage de la connectivité réseau.

INVALID_ARGUMENT

Des paramètres de configuration non valides, des secrets manquants, des autorisations incorrectes ou des paramètres de cluster mal configurés ont empêché le démarrage du cluster.

Exemple de message d'erreur

com.databricks.backend.manager.secret.SecretPermissionDeniedException: User does not have permission with scope: [REDACTED] and key: [REDACTED]

Étapes de dépannage

  1. Vérifiez le message d'erreur pour identifier le parameter invalide spécifique.
  2. Pour les erreurs de secret, vérifiez que le Secret Scope et la clé existent en utilisant l'API Secrets de Databricks.
  3. Vérifiez les autorisations d'utilisateur ou de Service Principal pour accéder aux secrets.
  4. Vérifiez la configuration du cluster pour les erreurs de syntaxe.
  5. Vérifier les scripts d'initialisation pour les erreurs de configuration.

Correction recommandée

Corrigez le parameter non valide en fonction du message d'erreur. Pour les secrets, vérifiez l’existence du périmètre et de la clé, contrôlez les autorisations et assurez-vous de la connectivité réseau aux fournisseurs de secrets. Validez toute la configuration du cluster par rapport à la documentation. Veuillez contacter le support Databricks si la configuration semble correcte.

INVALID_WORKER_ENVIRONMENT

Le cluster n'a pas pu démarrer car l'environnement de worker n'existe pas.

Cette erreur peut survenir immédiatement après la création du Workspace, pendant que l'environnement Worker est encore en cours de provisionnement.

Exemple de message d'erreur

[details] NO_SUCH_WORKER_ENVIRONMENT_EXCEPTION: Delegate unexpected exception during asynchronous instance launch com.databricks.backend.manager.util.WorkerEnvironmentNotFoundException: Worker environment

Étapes de dépannage

  1. Vérifiez quand le Workspace a été créé. S'il a été créé récemment, l'environnement Worker peut être toujours en cours de provisionnement.
  2. Consultez les Logs d'événements des clusters pour les détails de l'erreur d'environnement Worker.

Correction recommandée

Patientez plusieurs minutes après la création du Workspace, puis réessayez le lancement du cluster.

Contactez le support Databricks si l’erreur persiste sur un Workspace actif qui n’a pas été créé ou restauré récemment.

NETWORK_CHECK_CONTROL_PLANE_FAILURE / NETWORK_CHECK_CONTROL_PLANE_FAILURE_DUE_TO_MISCONFIG

Un contrôle de l'état du réseau avant le démarrage a échoué lors de la tentative d'atteindre le plan de contrôle Databricks. Les deux codes d'erreur partagent la même défaillance sous-jacente et les mêmes conseils de dépannage. NETWORK_CHECK_CONTROL_PLANE_FAILURE_DUE_TO_MISCONFIG est généralement signalé lorsque le Workspace présente un historique de défaillances similaires des contrôles de santé du réseau.

Exemple de message d'erreur

Instance failed network health check before bootstrapping with fatal error: X_NHC_CONTROL_PLANE_UNREACHABLE
1 failed component(s): control_plane
Retryable: true

Étapes de dépannage

  1. Consultez les Logs d'événements de cluster pour connaître les détails spécifiques des échecs de connexion.
  2. Testez la connectivité du plan de contrôle à partir d'une VM dans le même réseau.
  3. Vérifier la résolution DNS pour les Endpoints du plan de contrôle Databricks.
  4. Vérifiez si un pare-feu intercepte ou bloque le trafic.
  5. Vérifiez que les règles de pare-feu et les tables de routage autorisent le trafic HTTPS sortant.

Correction recommandée

Vérifiez que les règles de groupe de sécurité ou de NSG autorisent le trafic sortant vers le plan de contrôle Databricks. Corrigez la configuration DNS, du pare-feu et du routage si nécessaire. Si vous utilisez UDR avec un pare-feu, assurez-vous que les tags de service Databricks acheminent vers internet. Contactez l'assistance Databricks si la configuration réseau est vérifiée comme étant correcte, mais que la vérification de l'état de santé échoue toujours.

NETWORK_CHECK_DNS_SERVER_FAILURE / NETWORK_CHECK_DNS_SERVER_FAILURE_DUE_TO_MISCONFIG

Un contrôle de santé du réseau pré-démarrage a échoué car la machine virtuelle ne peut pas atteindre le serveur DNS configuré. Les deux codes d'erreur partagent la même défaillance sous-jacente et les mêmes conseils de dépannage. NETWORK_CHECK_DNS_SERVER_FAILURE_DUE_TO_MISCONFIG est généralement signalé lorsque le Workspace présente un historique de défaillances similaires des contrôles de santé du réseau.

Exemple de message d'erreur

[details] X_NHC_DNS_SERVER_UNREACHABLE: Instance failed network health check before bootstrapping with fatal error: X_NHC_DNS_SERVER_UNREACHABLE
4 failed component(s): control_plane dns_server internet storage
Retryable: true

Étapes de dépannage

  1. Vérifiez les adresses IP des serveurs DNS configurées pour le sous-réseau ou le VNet.
  2. Testez l'atteignabilité du serveur DNS depuis une VM dans le même réseau.
  3. Vérifiez les règles de pare-feu susceptibles de bloquer le trafic DNS sur le port 53.
  4. Vérifiez la configuration du serveur DNS personnalisé, les redirecteurs et les règles de transfert conditionnel.
  5. Testez la résolution DNS pour le plan de contrôle et les Endpoint de stockage Databricks à partir d'une VM dans le même réseau.
  6. Vérifiez l’absence de fautes de frappe ou d’adresses IP de serveur DNS inaccessibles dans la configuration réseau.

Correction recommandée

Assurez-vous que les serveurs DNS sont accessibles et fonctionnels à partir du réseau du plan de compute. Mettez à jour les règles de pare-feu ou de groupe de sécurité réseau (NSG) pour autoriser le trafic DNS. Si un serveur DNS personnalisé est inaccessible ou mal configuré, envisagez de passer au DNS default du fournisseur de cloud. Corrigez la configuration du serveur DNS et assurez-vous que les instances compute peuvent résoudre les Endpoints Databricks. Contactez l'assistance Databricks si la configuration DNS est vérifiée mais que les recherches échouent toujours.

ÉCHEC_VÉRIFICATION_RÉSEAU_PLUSIEURS_COMPOSANTS / ÉCHEC_VÉRIFICATION_RÉSEAU_PLUSIEURS_COMPOSANTS_DÛ_À_MAUVAISE_CONFIGURATION

Un contrôle d'intégrité du réseau avant le démarrage a échoué sur plusieurs composants réseau tels que le plan de contrôle, le stockage, le DNS ou la connectivité Internet. Les deux codes d'erreur partagent la même défaillance sous-jacente et les mêmes conseils de dépannage. NETWORK_CHECK_MULTIPLE_COMPONENTS_FAILURE_DUE_TO_MISCONFIG est généralement signalé lorsque le Workspace présente un historique de défaillances similaires des contrôles de santé du réseau.

Exemple de message d'erreur

Instance failed network health check before bootstrapping with fatal error: X_NHC_MULTIPLE_COMPONENTS_FAILURE
3 failed component(s): control_plane internet storage
Retryable: false

Étapes de dépannage

  1. Passez en revue les Logs d'événements des clusters pour identifier les composants qui n'ont pas réussi le contrôle d'intégrité.
  2. Tester la connectivité aux Endpoint du plan de contrôle, du stockage et du DNS à partir d'une VM dans le même réseau.
  3. Vérifier les pannes réseau généralisées ou les changements de pare-feu.
  4. Vérifiez si le problème est passager ou persistant.
  5. Passez en revue les modifications récentes de la configuration du pare-feu, du DNS, du proxy ou du routage.
  6. Vérifiez si une configuration d'injection Virtual Private Cloud (VPC) ou VNet gérée par le client bloque le trafic requis.

Correction recommandée

Résolvez les problèmes de connectivité réseau sous-jacents pour tous les composants en échec. Examinez le pare-feu, le DNS et la configuration de routage de manière globale. Corrigez la mauvaise configuration réseau affectant plusieurs Endpoint et assurez-vous que les paramètres autorisent l'accès au plan de contrôle Databricks et au stockage d'artefacts. Réessayez le lancement du cluster une fois les problèmes réseau résolus. Contactez le support Databricks si plusieurs composants échouent malgré une configuration réseau vérifiée.

NETWORK_CHECK_NIC_FAILURE

Une vérification de l'état du réseau avant le démarrage a détecté un problème de carte d'interface réseau (NIC) tel que l'interface étant inactive ou des routes requises manquantes.

Exemple de message d'erreur

Instance failed network health check before bootstrapping with fatal error: X_NHC_NIC_STATE_DOWN
1 failed component(s): nic
Retryable: true

Étapes de dépannage

  1. Consultez les Logs d'événements des clusters pour les erreurs d'état NIC ou de routage.
  2. Vérifier la configuration du sous-réseau et de la table de routage.
  3. Examinez les Logs et les métriques du système d'exploitation de la machine virtuelle pour les problèmes de mise en réseau au niveau de la carte réseau ou de l'hôte sur la console du fournisseur cloud.
  4. Confirmez que la machine virtuelle a été provisionnée sans erreur sur la console du fournisseur de services cloud.
  5. Vérifiez les incidents de réseau du fournisseur cloud dans la région.

Correction recommandée

Veuillez réessayer de lancer le cluster, car les problèmes de carte réseau sont souvent transitoires. Si le problème persiste, veuillez examiner la configuration réseau avec votre fournisseur cloud ou votre administrateur réseau. Veuillez contacter le support Databricks si les échecs persistent après plusieurs tentatives.

NETWORK_CHECK_STORAGE_FAILURE

Un contrôle de santé du réseau de pré-démarrage a échoué car la machine virtuelle ne peut pas atteindre le stockage d'artefacts Databricks.

Exemple de message d'erreur

[details] X_NHC_STORAGE_UNREACHABLE: Instance failed network health check before bootstrapping with fatal error: X_NHC_STORAGE_UNREACHABLE
2 failed component(s): internet storage
Retryable: true

Étapes de dépannage

  1. Tester la connectivité aux endpoints de stockage Databricks depuis une VM dans le même réseau.
  2. Vérifier la résolution DNS pour les URL de stockage.
  3. Vérifiez le pare-feu, le proxy et les règles de groupe de sécurité ou de NSG.
  4. Vérifiez si les dispositifs d'inspection TLS interfèrent avec les connexions de stockage.

Correction recommandée

Assurez-vous que les règles de pare-feu autorisent l'accès à l'Endpoint de stockage Databricks. Configurez les endpoints VPC ou de service le cas échéant. Si un serveur DNS personnalisé provoque des retards ou des échecs de résolution pour les URL de stockage, passez au DNS par default du fournisseur cloud ou corrigez la configuration DNS. Contactez le support Databricks si la connectivité du stockage est vérifiée, mais que la vérification de l'état échoue toujours.

NETWORK_CONFIGURATION_FAILURE

Une erreur de configuration réseau empêche la bonne configuration du réseau de la machine virtuelle ou des clusters.

Étapes de dépannage

  1. Passez en revue les règles de pare-feu et de groupe de sécurité ou de NSG.
  2. Vérifiez les tables de routage et la configuration de routage.
  3. Vérifier la configuration du sous-réseau.
  4. Vérifiez les conflits d'adresses IP.
  5. Vérifier les paramètres DNS.

Correction recommandée

Corrigez la configuration du réseau en fonction de l'erreur spécifique. Assurez-vous que les règles des groupes de sécurité ou des NSG autorisent le trafic requis, vérifiez que les plages CIDR des sous-réseaux ne se chevauchent pas, vérifiez que les tables de routage sont correctement configurées et assurez-vous que le DNS est fonctionnel. Contactez le support Databricks pour une révision de la configuration réseau.

ÉCHEC_INSTALLATION_TUNNEL_NPIP

Le script d'amorçage n'a pas réussi à établir la connexion du tunnel NPIP dans le délai imparti. Cela se produit après que le fournisseur de cloud lance l'instance et que le script d'amorçage tente d'établir le tunnel de relais SCC.

Exemple de message d'erreur

Cluster '[REDACTED]' was terminated. Reason: NPIP_TUNNEL_SETUP_FAILURE (SERVICE_FAULT). Parameters: databricks_error_message:VM setup failed due to Ngrok setup timeout. [details] NPIP_TUNNEL_SETUP_FAILURE: Instance bootstrap failed command: WaitForNgrokTunnel Failure message: Timed out waiting for ngrok tunnel to be up(OnDemand), instance_id:[REDACTED]

Étapes de dépannage

  1. Vérifiez la configuration du réseau entre le relais SCC et les sous-réseaux du plan de compute Databricks.
  2. Veuillez vérifier les paramètres de pare-feu et de proxy qui pourraient bloquer la configuration du tunnel sur le port 443 ou 6666.

Correction recommandée

Assurez la connectivité réseau du plan de compute à l'Endpoint de relais SCC. Lancez une instance dans le VPC/VNet du plan de compute Databricks et vérifiez la connectivité au relais SCC :

nslookup <SCC relay fqdn>
nc -vz <SCC relay fqdn> 443

Remplacez 443 par le port PL si vous utilisez un Link privé.

S'il y a un pare-feu ou un proxy, vérifiez qu'il autorise le trafic vers le relais sur les ports requis. Consultez la documentation publique de configuration réseau et assurez-vous d'avoir les règles de sortie appropriées configurées et de pouvoir vous connecter à l'endpoint SCC depuis votre VPC/VNet. Si le problème persiste même si la configuration de votre réseau ne pose aucun problème, contactez l’assistance Databricks.

RATE_LIMITED

Le lancement du cluster a fait l'objet d'une limitation de débit parce que le Workspace a dépassé sa capacité ou ses limites de requête.

Exemple de message d'erreur

Your workspace upsize request timed out because it exceeded the workspace-level capacity limit.

Étapes de dépannage

  1. Vérifiez si plusieurs clusters ou Jobs se lancent simultanément.
  2. Examiner l'activité concurrente des clusters et des Jobs dans le Workspace.
  3. Identifiez si la défaillance se produit pendant les périodes de pointe d'utilisation.
  4. Vérifiez les Logs d'événements du cluster pour les messages de limitation au niveau du Workspace.

Correction recommandée

Réduire les lancements de clusters simultanés, décaler les planifications de Jobs ou attendre avant de réessayer. Demandez une augmentation de la limite de capacité du Workspace via l'assistance Databricks si votre charge de travail nécessite constamment un degré de concurrence plus élevé. Relancez le cluster une fois que la limitation aura diminué.

REQUEST_THROTTLED

Les requêtes d'API au fournisseur cloud sont limitées en raison de la limitation du débit.

Exemple de message d'erreur

TEMPORARILY_UNAVAILABLE: Too many requests from workspace [REDACTED]

Étapes de dépannage

  1. Vérifiez si plusieurs clusters sont lancés simultanément.
  2. Vérifiez les limites de débit des requêtes API pour votre compte.
  3. Déterminez si d'autres services effectuent des appels API simultanés.
  4. Vérifier les systèmes automatisés effectuant des requêtes fréquentes.

Correction recommandée

Réduisez les lancements de clusters simultanés, demandez à votre fournisseur de cloud une augmentation de la limite de débit de l'API, mettez en œuvre un retrait exponentiel dans les scripts d'automatisation, ou étalez les heures de lancement des clusters.

SPOT_INSTANCE_TERMINATION

Les instances Spot ou préemptables ont été arrêtées par le fournisseur de cloud en raison de besoins en capacité ou de changements de Tarifs.

Exemple de message d'erreur

Server.SpotInstanceTermination: Spot instance termination

Étapes de dépannage

  1. Vérifiez les logs d'événements du cluster pour le timestamp de terminaison.
  2. Examinez l'historique des prix spot dans votre région.
  3. Identifiez si les terminaisons se produisent à des moments spécifiques.
  4. Vérifier si plusieurs instances ont été terminées simultanément.

Correction recommandée

Passez aux instances à la demande pour les charges de travail de production, implémentez une logique de nouvelle tentative de Job pour gérer les interruptions, ou utilisez un mélange d'instances à la demande et Spot. Les instances Spot sont idéales pour les charges de travail tolérantes aux pannes.

SPARK_IMAGE_DOWNLOAD_FAILURE

Le cluster n'a pas réussi à download l'image conteneur Spark à partir du stockage d'artefacts Databricks pendant le démarrage.

Exemple de message d'erreur

Failed to set up spark container due to an image download failure: Exception when downloading spark image:

Étapes de dépannage

  1. Vérifier la connectivité au stockage d'artefacts Databricks depuis le réseau du plan de compute.
  2. Vérifier la résolution DNS pour les Endpoints de stockage.
  3. Vérifiez les règles de pare-feu, de proxy et de groupe de sécurité ou de groupe de sécurité réseau (NSG).
  4. Vérifiez si le problème affecte plusieurs clusters ou un seul cluster.

Correction recommandée

Assurez-vous de la connectivité réseau aux endpoints de stockage Databricks. Configurez des endpoints de service ou de Virtual Private Cloud (VPC), le cas échéant, afin d'améliorer la fiabilité du download. Réessayez le lancement du cluster. Contactez le support Databricks si la connectivité est vérifiée mais que les téléchargements échouent toujours.

SPARK_IMAGE_NOT_FOUND

L'image Spark spécifiée n'existe pas dans le stockage d'artefacts Databricks.

Exemple de message d'erreur

Failed to set up the Spark container on instance [REDACTED] could not find internal Spark image snapshot__17.x-snapshot-scala2.13__databricks__17.4.0_

Étapes de dépannage

  1. Vérifiez la version de Databricks Runtime configurée sur le cluster.
  2. Vérifier si un nom ou une balise d'image Spark personnalisé est spécifié.
  3. Confirmez que la version de l'environnement d'exécution est prise en charge dans votre région de workspace.
  4. Examinez les modifications récentes de la configuration de cluster ou de job.

Correction recommandée

Sélectionnez une version prise en charge de Databricks Runtime ou vérifiez l’existence de l’image Spark personnalisée. Mettez à jour la configuration du cluster pour utiliser une version d'environnement d'exécution valide et relancez le lancement. Contactez le support Databricks si la version de l'environnement d'exécution doit être disponible mais que l'image est introuvable.

SPARK_STARTUP_FAILURE

Le driver Spark n’a pas démarré dans le délai configuré. Cela peut se produire lorsque le Startup du daemon Driver n’a pas été achevé dans le délai (généralement 200 secondes) sur l’instance du Driver du cluster.

Exemples de messages d'erreur

Cluster '[REDACTED]' was terminated. Reason: SPARK_STARTUP_FAILURE (SERVICE_FAULT). Parameters: databricks_error_message:Spark failed to start: DEADLINE_EXCEEDED.
Cluster '[REDACTED]' was terminated. Reason: SPARK_STARTUP_FAILURE (SERVICE_FAULT). Parameters: databricks_error_message:Spark failed to start: Timed out after 200 seconds.

Étapes de dépannage

  1. Vérifiez la configuration Spark pour les erreurs de configuration (par exemple, URI de metastore invalide ou paramètres conflictuels).
  2. Vérifiez vos scripts d'initialisation pour des erreurs potentielles qui pourraient retarder ou empêcher le Startup du Driver.

Correction recommandée

Supprimez les configurations Spark personnalisées et les scripts d'initialisation pour isoler le problème. Essayez un type d'instance différent, car la lenteur matérielle sur des instances plus petites peut entraîner des délais d'expiration au Startup du Driver. Si le problème persiste, contactez l'assistance Databricks avec l'ID du cluster et les détails de l'erreur.

STORAGE_DOWNLOAD_FAILURE_SLOW

Le download d'artefacts du stockage Databricks échoue ou est trop lent en raison de problèmes de connectivité réseau, de pare-feu ou de DNS.

Exemple de message d'erreur

Instance bootstrap failed command: Command_UpdateWorker
Failure message: Trying DNS probe for: https://[REDACTED].blob.core.windows.net/update/worker-artifacts/...

Étapes de dépannage

  1. Vérifiez les règles de pare-feu pour les Endpoint de stockage Databricks.
  2. Vérifier la résolution DNS pour les URL de stockage.
  3. Tester la vitesse de download à partir d'une VM dans le même réseau.
  4. Examinez l'utilisation de la bande passante réseau.
  5. Vérifiez la présence de proxy ou de périphériques d'inspection réseau.
  6. Vérifier les itinéraires vers les endpoints de stockage.

Correction recommandée

Assurez-vous que les règles de pare-feu autorisent l’accès aux Endpoint de stockage Databricks.

Configurez des points de terminaison Virtual Private Cloud (VPC) pour S3 afin d'éviter le routage des artifact download via l'internet public.

Examinez et optimisez les dispositifs d'inspection réseau, le cas échéant. Contactez l'assistance Databricks si la connectivité aux Endpoint de stockage est vérifiée mais que les download échouent toujours.

STORAGE_DOWNLOAD_FAILURE_THROTTLED

Les téléchargements d'artefacts pendant le bootstrap sont limités par le fournisseur de stockage cloud en raison d'une charge élevée ou de limites de sortie.

Exemple de message d'erreur

Worker artifact download servers are seeing elevated load and throttling requests.

Étapes de dépannage

  1. Consultez les logs d'événements du cluster pour les erreurs de limitation spécifiques au stockage (par exemple, HTTP 503 ou ServerBusy).

Correction recommandée

Veuillez réessayer le lancement du cluster après un court délai. Veuillez contacter le support Databricks si le problème persiste après plusieurs tentatives de réessai.

ERREUR_WORKSPACE_ANNULÉ

Le lancement du cluster a échoué parce que le Workspace a été annulé pendant que le cluster était en cours de provisionnement.

Exemple de message d'erreur

Workspace Cancelled Error

Étapes de dépannage

  1. Vérifiez si le Workspace a été annulé ou supprimé pendant le lancement du cluster.
  2. Examinez le statut du workspace dans la console du compte.
  3. Déterminez si des demandes d'agrandissement de cluster étaient en cours lorsque le workspace a été annulé.

Correction recommandée

Créez un nouveau workspace. Contactez l'assistance Databricks si le workspace semble actif mais que les clusters se terminent toujours avec cette erreur.

WORKSPACE_CONFIGURATION_ERROR

Une erreur de configuration au niveau du Workspace empêche le lancement de clusters, notamment des problèmes avec les rôles IAM ou les autorisations de Service Principal.

Exemple de message d'erreur

User: arn:aws:iam::[REDACTED]:user/ConsolidatedManagerIAMUser is not authorized to perform: sts:AssumeRole on resource: arn:aws:iam::[REDACTED]:role/databricks-workspace-stack-role

Étapes de dépannage

  1. Passez en revue les modifications récentes apportées à la configuration du Workspace.

  2. Veuillez vérifier la console du fournisseur cloud pour les modifications de politique ou d'autorisation.

  3. Vérifiez la configuration de la relation d'approbation du rôle IAM inter-comptes et les autorisations du profil d'instance pour assumer les rôles requis.

Correction recommandée

Vérifiez les relations de confiance des rôles IAM et les autorisations des profils d’instance. Examinez la configuration de la sécurité de l'Workspace.

Contactez l'assistance Databricks si la configuration du Workspace semble correcte ou si la configuration du rôle inter-comptes nécessite une vérification.