Aller au contenu principal

De nombreux petits Jobs Spark

Si vous voyez de nombreux petits Jobs, il est probable que vous effectuiez de nombreuses Opérations sur des données relativement petites (<10 Go). Chaque petite opération ne prend que quelques secondes, mais ces temps s'accumulent, et le temps passé en frais généraux par opération s'additionne également.

La meilleure approche pour accélérer les petits Jobs est d'exécuter plusieurs opérations en parallèle. Les LakeFlow Pipelines le font automatiquement pour vous.

Autres options :

  • Séparez vos opérations en plusieurs notebooks et exécutez-les en parallèle sur le même cluster en utilisant les jobs multitâches.
  • Utilisez les SQL Warehouse si toutes vos queries sont écrites en SQL. Les SQL Warehouse montent très bien en charge pour de nombreuses queries exécutées en parallèle, car ils ont été conçus pour ce type de charge de travail.
  • Paramétrez votre Notebook et utilisez la tâche pour chaque élément pour exécuter votre Notebook plusieurs fois en parallèle. Utilisez la **simultanéité** pour définir le niveau de parallélisation. Cela fonctionne bien avec le compute serverless.