Spark Submit (ancienne, obsolète, suppression prévue pour mi-2026)
Le type de tâche Spark Submit est un modèle hérité pour la configuration des JARs en tant que tâches.
La tâche Spark Submit est obsolète et en attente de suppression mi-2026. L'utilisation de ce type de tâche est interdite pour les nouveaux cas d'utilisation et fortement déconseillée pour les clients existants. Databricks recommande d'utiliser plutôt la tâche **JAR** pour les charges de travail JVM. Voir la tâche JAR pour les jobs.
Limitations
- Vous ne pouvez exécuter des tâches spark-submit que sur de nouveaux clusters.
- Vous devez upload votre fichier JAR vers un emplacement ou un repository Maven compatible avec votre configuration de compute. Consultez la prise en charge des bibliothèques Java et Scala.
- Vous ne pouvez pas accéder aux fichiers JAR stockés dans des volumes.
- Spark-submit ne prend pas en charge la mise à l'échelle automatique des clusters. Pour en savoir plus sur la mise à l'échelle automatique, consultez Mise à l'échelle automatique des clusters.
- Spark-submit ne prend pas en charge l'arrêt automatique de cluster. Les Spark applications lancées à l'aide de Spark-submit doivent explicitement appeler
System.exitlorsqu'elles sont terminées. - Spark-submit ne prend pas en charge les bibliothèques Databricks (référence
dbutils). Pour utiliser les bibliothèques Databricks, utilisez plutôt des tâches JAR. - Si vous utilisez un cluster compatible Unity Catalog, spark-submit est pris en charge uniquement si le cluster utilise le mode d’accès dédié. Le mode d’accès standard n’est pas pris en charge. Voir Modes d'accès.
- Les jobs Structured Streaming ne doivent jamais avoir le nombre maximal d’exécutions simultanées défini à une valeur supérieure à 1. Les Jobs de streaming doivent être configurés pour s'exécuter à l'aide de l'expression cron
"* * * * * ?"(toutes les minutes). Puisqu'une tâche de streaming s'exécute en continu, elle doit toujours être la tâche finale d'un Job.
Configurer une tâche Spark Submit
Ajoutez une tâche Spark Submit depuis l'onglet tab dans l'interface utilisateur des jobs en procédant comme suit :
-
Cliquez sur
Ajouter une tâche .
-
Saisissez un nom dans le champ Nom de la tâche .
-
Dans le menu déroulant Type , sélectionnez
Spark Submit. -
Utilisez Compute pour configurer un cluster qui prend en charge la logique de votre tâche.
-
Utilisez la zone de texte Paramètres pour fournir tous les arguments et configurations nécessaires à l'exécution de votre tâche sous la forme d'un tableau JSON de chaînes.
-
Les trois premiers arguments sont utilisés pour identifier la classe principale à exécuter dans un JAR à un chemin spécifié, comme dans l'exemple suivant :
JSON["--class", "org.apache.spark.mainClassName", "dbfs:/Filestore/libraries/jar_path.jar"] -
Vous ne pouvez pas remplacer les paramètres
master,deploy-modeetexecutor-coresconfigurés par Databricks -
Utilisez
--jarset--py-filespour ajouter des bibliothèques Java, Scala et Python dépendantes. -
Utilisez
--confpour définir les configurations Spark. -
Les arguments
--jars,--py-files,--filesprennent en charge les chemins DBFS et S3. -
Par default, le Job Spark Submit utilise toute la mémoire disponible, à l'exclusion de la mémoire réservée aux services Databricks. Vous pouvez définir
--driver-memoryet--executor-memoryà une valeur plus petite afin de laisser de la place pour l'utilisation hors tas.
-
-
Cliquez sur Enregistrer la tâche .