Aller au contenu principal

Jobs ou exécuteurs défaillants supprimés

Donc, vous voyez des jobs ayant échoué ou des exécuteurs supprimés :

Jobs défaillants

Les raisons les plus courantes de la suppression des exécuteurs sont :

  • Dimensionnement automatique : Dans ce cas, c'est attendu et non une erreur. Consultez Activer le dimensionnement automatique.
  • Pertes d'instances ponctuelles : le fournisseur de cloud récupère vos VM. Vous pouvez en savoir plus sur les instances Spot ici.
  • Exécuteurs à court de mémoire

Jobs en échec

Si vous voyez des jobs en échec, cliquez dessus pour accéder à leurs pages. Faites ensuite défiler vers le bas pour voir l'étape et la raison de l'échec :

Raison de l'échec

Vous pouvez recevoir une erreur générique. Cliquez sur le Link dans la description pour en savoir plus :

Description de l'échec

Si vous faites défiler vers le bas dans cette page, vous pourrez voir pourquoi chaque tâche a échoué. Dans ce cas, il devient clair qu'il y a un problème de mémoire :

Tâches échouées

Exécuteurs défaillants

Pour savoir pourquoi vos exécuteurs échouent, vous voudrez d'abord vérifier le Journal des événements du compute pour voir s'il y a une explication à l'échec des exécuteurs. Par exemple, il est possible que vous utilisiez des instances spot et que le fournisseur cloud les reprenne.

Journal des événements

Veuillez vérifier s'il y a des événements expliquant la perte d'exécuteurs. Par exemple, vous pouvez voir des messages indiquant que le cluster est en cours de redimensionnement ou que des instances Spot sont perdues.

Si vous ne voyez aucune information dans le journal des Log, retournez à l'interface **Spark UI**, puis cliquez sur l'onglet **Executors** :

tab Exécuteurs

Vous pouvez obtenir les logs des exécuteurs ayant échoué :

Exemple d'exécuteurs en échec

Étape suivante

Si vous êtes arrivé jusque-là, l’explication la plus probable est un problème de mémoire. L'étape suivante consiste à examiner les problèmes de mémoire. Voir problèmes de mémoire Spark.