Jobs ou exécuteurs défaillants supprimés
Donc, vous voyez des jobs ayant échoué ou des exécuteurs supprimés :

Les raisons les plus courantes de la suppression des exécuteurs sont :
- Dimensionnement automatique : Dans ce cas, c'est attendu et non une erreur. Consultez Activer le dimensionnement automatique.
- Pertes d'instances ponctuelles : le fournisseur de cloud récupère vos VM. Vous pouvez en savoir plus sur les instances Spot ici.
- Exécuteurs à court de mémoire
Jobs en échec
Si vous voyez des jobs en échec, cliquez dessus pour accéder à leurs pages. Faites ensuite défiler vers le bas pour voir l'étape et la raison de l'échec :

Vous pouvez recevoir une erreur générique. Cliquez sur le Link dans la description pour en savoir plus :

Si vous faites défiler vers le bas dans cette page, vous pourrez voir pourquoi chaque tâche a échoué. Dans ce cas, il devient clair qu'il y a un problème de mémoire :

Exécuteurs défaillants
Pour savoir pourquoi vos exécuteurs échouent, vous voudrez d'abord vérifier le Journal des événements du compute pour voir s'il y a une explication à l'échec des exécuteurs. Par exemple, il est possible que vous utilisiez des instances spot et que le fournisseur cloud les reprenne.

Veuillez vérifier s'il y a des événements expliquant la perte d'exécuteurs. Par exemple, vous pouvez voir des messages indiquant que le cluster est en cours de redimensionnement ou que des instances Spot sont perdues.
- Si vous utilisez des instances ponctuelles, consultez Perte d’instances ponctuelles.
- Si votre compute a été redimensionné avec la mise à l'échelle automatique, c'est attendu et non une erreur. Consultez En savoir plus sur le redimensionnement des clusters.
Si vous ne voyez aucune information dans le journal des Log, retournez à l'interface **Spark UI**, puis cliquez sur l'onglet **Executors** :

Vous pouvez obtenir les logs des exécuteurs ayant échoué :

Étape suivante
Si vous êtes arrivé jusque-là, l’explication la plus probable est un problème de mémoire. L'étape suivante consiste à examiner les problèmes de mémoire. Voir problèmes de mémoire Spark.