Aller au contenu principal

Spark Submit (ancienne, obsolète, suppression prévue pour mi-2026)

Le type de tâche Spark Submit est un modèle hérité pour la configuration des JARs en tant que tâches.

attention

La tâche Spark Submit est obsolète et en attente de suppression mi-2026. L'utilisation de ce type de tâche est interdite pour les nouveaux cas d'utilisation et fortement déconseillée pour les clients existants. Databricks recommande d'utiliser plutôt la tâche **JAR** pour les charges de travail JVM. Voir la tâche JAR pour les jobs.

Limitations

  • Vous ne pouvez exécuter des tâches spark-submit que sur de nouveaux clusters.
  • Vous devez upload votre fichier JAR vers un emplacement ou un repository Maven compatible avec votre configuration de compute. Consultez la prise en charge des bibliothèques Java et Scala.
  • Vous ne pouvez pas accéder aux fichiers JAR stockés dans des volumes.
  • Spark-submit ne prend pas en charge la mise à l'échelle automatique des clusters. Pour en savoir plus sur la mise à l'échelle automatique, consultez Mise à l'échelle automatique des clusters.
  • Spark-submit ne prend pas en charge l'arrêt automatique de cluster. Les Spark applications lancées à l'aide de Spark-submit doivent explicitement appeler System.exit lorsqu'elles sont terminées.
  • Spark-submit ne prend pas en charge les bibliothèques Databricks (référence dbutils). Pour utiliser les bibliothèques Databricks, utilisez plutôt des tâches JAR.
  • Si vous utilisez un cluster compatible Unity Catalog, spark-submit est pris en charge uniquement si le cluster utilise le mode d’accès dédié. Le mode d’accès standard n’est pas pris en charge. Voir Modes d'accès.
  • Les jobs Structured Streaming ne doivent jamais avoir le nombre maximal d’exécutions simultanées défini à une valeur supérieure à 1. Les Jobs de streaming doivent être configurés pour s'exécuter à l'aide de l'expression cron "* * * * * ?" (toutes les minutes). Puisqu'une tâche de streaming s'exécute en continu, elle doit toujours être la tâche finale d'un Job.

Configurer une tâche Spark Submit

Ajoutez une tâche Spark Submit depuis l'onglet tab dans l'interface utilisateur des jobs en procédant comme suit :

  1. Cliquez sur Icône Plus. Ajouter une tâche .

  2. Saisissez un nom dans le champ Nom de la tâche .

  3. Dans le menu déroulant Type , sélectionnez Spark Submit.

  4. Utilisez Compute pour configurer un cluster qui prend en charge la logique de votre tâche.

  5. Utilisez la zone de texte Paramètres pour fournir tous les arguments et configurations nécessaires à l'exécution de votre tâche sous la forme d'un tableau JSON de chaînes.

    • Les trois premiers arguments sont utilisés pour identifier la classe principale à exécuter dans un JAR à un chemin spécifié, comme dans l'exemple suivant :

      JSON
      ["--class", "org.apache.spark.mainClassName", "dbfs:/Filestore/libraries/jar_path.jar"]
    • Vous ne pouvez pas remplacer les paramètres master, deploy-mode et executor-cores configurés par Databricks

    • Utilisez --jars et --py-files pour ajouter des bibliothèques Java, Scala et Python dépendantes.

    • Utilisez --conf pour définir les configurations Spark.

    • Les arguments --jars, --py-files, --files prennent en charge les chemins DBFS et S3.

    • Par default, le Job Spark Submit utilise toute la mémoire disponible, à l'exclusion de la mémoire réservée aux services Databricks. Vous pouvez définir --driver-memory et --executor-memory à une valeur plus petite afin de laisser de la place pour l'utilisation hors tas.

  6. Cliquez sur Enregistrer la tâche .