Driver Spark surchargé
Vous avez donc déterminé que votre driver est surchargé. La raison la plus courante à cela est qu'il y a trop d'éléments concurrents en cours d'exécution sur le cluster. Cela peut être dû à un trop grand nombre de Stream, de requêtes ou de Job Spark (certains clients utilisent des threads pour exécuter de nombreux Job Spark simultanément).
Il est également possible que vous exécutiez du code non-Spark sur votre cluster qui maintient le Driver occupé. Si vous constatez des lacunes dans votre frise chronologique causées par l'exécution de code non-Spark, cela signifie que vos Workers sont tous inactifs et risquent de gaspiller de l'argent pendant ces périodes. C'est peut-être intentionnel et inévitable, mais si vous pouvez écrire ce code pour utiliser Spark, vous utiliserez pleinement le cluster. start with ce tutoriel pour apprendre à travailler avec Spark.
Si vous avez trop de choses en cours d'exécution sur le cluster simultanément, vous avez trois options :
- Augmentez la taille de votre driver.
- Réduire la concurrence
- Répartir la charge sur plusieurs clusters
Databricks vous recommande d'abord d'essayer de doubler la taille du Driver et de voir comment cela impacte votre Job.