Aller au contenu principal

Diagnostiquer les problèmes de coût et de performance à l'aide de l'interface utilisateur Spark

Ce guide vous explique comment utiliser l’interface Spark UI pour diagnostiquer les problèmes de coût et de performance. C'est un guide étape par étape et c'est un guide pratique. Plutôt que de simplement vous fournir une explication de ce que fait chaque page dans la Spark UI, il vous indique ce qu'il faut rechercher et ce que cela signifie. Si vous n'êtes pas familier avec les concepts de Driver, de Worker, d'exécuteurs, de stages et de tâches, vous voudrez peut-être revoir l'architecture Spark.

Si vous recherchez une liste complète des différents outils d'optimisation, utilisez le guide d'optimisation Databricks. Les sections du guide d'optimisation sont référencées dans ce guide Spark UI.

Utilisation de ce guide

Pour parcourir le guide, utilisez les Links intégrés à chaque page pour passer à l'étape suivante. Le guide contient les étapes suivantes, dans l'ordre :

  1. Utilisez la chronologie des jobs pour identifier les problèmes majeurs
  2. Regardez l'étape la plus longue.
  3. Rechercher une asymétrie ou un spill
  4. Déterminer si l'étape la plus longue est liée aux E/S
  5. Rechercher d'autres causes de ralentissement de l'exécution de l'étape

Commençons !

Comment ouvrir la Spark UI

  1. Accédez à la page de votre cluster :

    Accédez à Compute

  2. Click Spark UI :

    Accédez à SparkUI

Étape suivante

Maintenant que vous avez ouvert la Spark UI, examinez ensuite la chronologie des événements pour en savoir plus sur votre pipeline ou votre query. Consultez la chronologie des tâches.