Aller au contenu principal

Configurer un pipeline Serverless

Les pipelines Serverless s'exécutent sur un compute géré par Databricks, éliminant la majeure partie de la configuration de l'infrastructure.

Databricks recommande de développer de nouveaux pipelines en utilisant le serverless. Certaines charges de travail peuvent nécessiter la configuration du compute classique ou l'utilisation du Hive metastore hérité. Consultez Configurer le compute classique pour les pipelines et Utiliser les Lakeflow pipelines avec le Hive metastore hérité.

remarque
  • Les pipelines Serverless utilisent toujours Unity Catalog. Consultez Utiliser Unity Catalog avec des pipelines.

  • Pour les limitations du compute Serverless, consultez Limitations du compute Serverless. Les limitations du Trigger de Structured Streaming décrites ici ne s'appliquent pas aux modes de pipeline. Les pipelines Serverless prennent en charge les modes déclenchés, continus et temps réel. Consultez Mode de pipeline déclenché ou continu.

  • Vous ne pouvez pas ajouter manuellement les paramètres de compute dans un objet clusters dans la configuration JSON pour un pipeline Serverless. Toute tentative de ce faire entraîne une erreur.

  • Si vous devez utiliser une connexion AWS PrivateLink avec vos LakeFlow Pipelines serverless, contactez votre représentant Databricks.

Exigences

Configuration recommandée pour les pipelines serverless

important

L'autorisation de création de clusters n'est pas requise pour configurer des pipelines Serverless. Par default, tous les utilisateurs du Workspace peuvent utiliser les pipelines Serverless.

Les pipelines Serverless suppriment la plupart des options de configuration, car Databricks gère toute l'infrastructure. Lorsque vous créez un nouveau pipeline, le comportement par default est d'utiliser le Serverless. Pour savoir comment configurer un pipeline Serverless, consultez Configurer les pipelines.

Vous pouvez également convertir les pipelines existants configurés avec Unity Catalog pour utiliser le serverless. Voir Convertir un pipeline existant pour utiliser le serverless.

Autres considérations de configuration

Les options de configuration suivantes sont également disponibles pour les pipelines Serverless :

Politique d’utilisation serverless

info

Aperçu

Cette fonctionnalité est en aperçu public.

Les politiques d'utilisation Serverless permettent à votre organisation d'appliquer des tags personnalisés à l'utilisation Serverless pour une attribution de facturation granulaire. Après avoir sélectionné la case à cocher Serverless , le paramètre Politique d'utilisation apparaît, où vous pouvez sélectionner la politique que vous souhaitez appliquer au pipeline. Les tags sont hérités de la politique d'utilisation serverless et ne peuvent être modifiés que par les administrateurs de workspace.

remarque

Une fois qu'une politique d'utilisation Serverless vous a été attribuée, vos pipelines existants ne sont pas automatiquement étiquetés avec votre politique. Vous devez mettre à jour manuellement les pipelines existants si vous souhaitez leur associer une politique.

Pour en savoir plus sur les politiques d'utilisation serverless, consultez Attribuer l'utilisation avec les politiques d'utilisation serverless.

Sélectionnez un mode de performance

Pour les Trigger pipelines, vous pouvez sélectionner le mode de performance du compute Serverless à l’aide du paramètre Performance optimized dans le planificateur de pipeline. Lorsque ce paramètre est désactivé, le pipeline utilise le mode de performance standard. Le mode de performance standard est conçu pour réduire les coûts des charges de travail pour lesquelles une latence de lancement légèrement plus élevée est acceptable. Les charges de travail Serverless utilisant le mode de performance standard start généralement dans les quatre à six minutes après avoir été Trigger, en fonction de la disponibilité du compute et de la planification optimisée.

Lorsque le mode Performance optimized est activé, votre pipeline est optimisé pour les performances, ce qui accélère le Startup et l’exécution des charges de travail sensibles au facteur temps.

Les deux modes utilisent le même SKU, mais le mode de performance standard consomme moins de DBU, ce qui reflète une utilisation moindre du compute.

remarque

Pour utiliser le mode de performance standard dans les pipelines continus, contactez votre équipe de compte Databricks.

Fonctionnalités des pipelines Serverless

Outre la simplification de la configuration, les pipelines Serverless disposent des fonctionnalités suivantes :

  • Incremental refresh for Materialized views : Les mises à jour des vues matérialisées sont refreshed de manière incrémentielle chaque fois que possible. L'incremental refresh a les mêmes résultats qu'un recalcul complet. La mise à jour utilise un refresh complet si les résultats ne peuvent pas être calculés de manière incrémentielle. Voir Incremental refresh pour les vues matérialisées.

  • Pipeline de Stream : Pour améliorer l'utilisation, le throughput et la latence des charges de travail de données en streaming, telles que l'ingestion de données, les micro-lots sont traités en pipeline . Autrement dit, au lieu d'exécuter des micro-lots séquentiellement comme un Spark Structured Streaming standard, les LakeFlow Pipelines serverless exécutent des micro-lots simultanément, améliorant l'utilisation des ressources de compute. Le Stream pipelining est activé par default dans les pipelines serverless.

  • Mise à l'échelle verticale automatique : les LakeFlow Pipelines serverless s'ajoutent à la mise à l'échelle horizontale automatique fournie par la mise à l'échelle automatique améliorée de Databricks en allouant automatiquement les types d'instances les plus rentables qui peuvent exécuter votre pipeline sans échouer en raison d'erreurs de mémoire insuffisante. Consultez Qu'est-ce que l'autoscaling vertical ?

Convertissez un pipeline existant pour utiliser le Serverless.

Vous pouvez convertir des pipelines existants configurés avec Unity Catalog en pipelines Serverless. Suivez les étapes suivantes :

  1. Dans la barre latérale de votre workspace Databricks, cliquez sur Jobs & Pipelines .
  2. Cliquez sur le Nom du pipeline.
  3. Cliquez sur Paramètres .
  4. Dans la barre latérale droite, sous Compute , cliquez sur Icône de crayon..
  5. Cochez la case à côté de Serverless .
  6. Cliquez sur Enregistrer .
important

Lorsque vous activez le serverless, tous les paramètres de compute que vous avez configurés pour un pipeline sont supprimés. Si vous rebasculez un pipeline vers des mises à jour non serverless, vous devez reconfigurer les paramètres de compute souhaités dans la configuration du pipeline.

Recherchez l'utilisation des DBU d'un pipeline serverless

Vous pouvez trouver l'utilisation de DBU des LakeFlow Pipelines Serverless en interrogeant la table d'utilisation facturable, qui fait partie des tables système Databricks. Consultez Quelle est la consommation de DBU d'un pipeline serverless ?.