Tâche de pipeline pour les Jobs
Lakeflow Jobs offre une approche procédurale pour définir les relations entre les *tâches*. Les pipelines Lakeflow offrent une approche déclarative pour définir les relations entre les datasets et les transformations . Planifiez un Trigger pipeline à exécuter en tant que tâche dans un Job, en utilisant l'interface utilisateur des Jobs, l'interface utilisateur des LakeFlow Pipelines ou SQL.
Un Trigger est un pipeline qui ne s'exécute pas en continu, mais qui doit être Trigger pour start. Une tâche de pipeline peut être le mécanisme de Trigger d'un pipeline déclenché. Les pipelines continus n'ont pas besoin d'être Triggered, donc les trigger via une tâche serait redondant. Pour en savoir plus sur les pipelines Trigger et continus, consultez Mode de pipeline Trigger vs. continu.
Configurez une tâche de pipeline avec l'interface utilisateur des tâches
Les LakeFlow pipelines gèrent toutes les configurations du code source et du compute dans la définition du pipeline.
Pour ajouter un pipeline à un Job, suivez les étapes suivantes :
- Créez et nommez une nouvelle tâche, puis sélectionnez pipeline pour le Type .
- Dans le menu déroulant Pipeline , sélectionnez un pipeline existant. Le pipeline doit être un pipeline déclenché. Les pipelines continus ne sont pas pris en charge en tant que tâche de Job.
- Vous pouvez éventuellement Trigger une refresh complète sur le pipeline.
- Vous pouvez facultativement définir des substitutions de parameter dans le champ Parameters . See parameter.
- (Facultatif) Pour configurer les nouvelles tentatives, les threshold de durée d'exécution ou de backlog de streaming, ou les notifications, consultez Paramètres de tâches avancés.
Vous pouvez également créer un nouveau pipeline d'ingestion lors de la création d'une tâche en sélectionnant Nouveau pipeline d'ingestion dans le volet Ajouter une tâche ou la liste déroulante Type des tâches.
Pour modifier, cloner, désactiver ou supprimer cette tâche, consultez Configurer et modifier les tâches dans Lakeflow Jobs.
pipeline de synchronisation de tables de base de données
La tâche de pipeline de synchronisation de tables de base de données est une tâche de pipeline qui exécute le pipeline en maintenant une table synchronisée Lakebase. Utilisez-le pour refresh une table synchronisée selon une planification, ou lorsque la table source de Unity Catalog change, afin que les applications opérationnelles lisent les données actuelles depuis Lakebase Postgres.
Dans le menu déroulant Type de tâche, Pipeline de synchronisation de tables de base de données apparaît sous Ingestion et Transformations . La sélection de celui-ci configure une tâche de pipeline. Dans le champ Pipeline , choisissez le pipeline associé à la table synchronisée que vous souhaitez refresh.
Lakebase propose deux offres. La table synchronisée que vous souhaitez refresh détermine l'ensemble d'instructions à suivre :
- Lakebase Autoscaling est l'offre pour les nouvelles instances. Pour configurer la tâche pour une table synchronisée à mise à l'échelle automatique, consultez tâche de pipeline de synchronisation de table de base de données.
- Lakebase Provisionnée est l'offre originale. Pour configurer la tâche pour une table synchronisée de provisionnement, consultez la tâche de pipeline de synchronisation de table de base de données.
Pipeline d'ingestion
La tâche de pipeline d'ingestion est une tâche de pipeline qui exécute un pipeline d'ingestion. Dans la liste déroulante Type de tâche, le choix du pipeline d'ingestion start l'assistant Ajouter des données , qui crée une tâche de pipeline pour un pipeline d'ingestion.
La première page de l'assistant demande la source de données. Les pages suivantes dépendent de la source que vous sélectionnez. Par exemple, si vous sélectionnez MySQL, consultez Option 1 : Interface utilisateur Databricks pour connaître les étapes. Pour les sources disponibles, consultez Connecteurs gérés dans Lakeflow Connect.
parameter
Bêta
Cette fonctionnalité est en Bêta. Les administrateurs du Workspace peuvent contrôler l'accès à cette fonctionnalité à partir de la page Previews . Consultez Gérer les aperçus Databricks.
Vous pouvez accéder aux paramètres de job ou de tâche dans la tâche de votre pipeline à l’aide de références de valeur dynamiques. Vous pouvez remplacer les paramètres en ajoutant des paires clé - valeur dans les Paramètres de la configuration de votre tâche.
Pour plus de détails sur la façon d'accéder aux valeurs des parameters depuis votre pipeline, consultez Accéder aux valeurs des parameters depuis une tâche.
Limites de concurrence avec les tâches de pipeline
Un pipeline ne peut exécuter qu'une seule mise à jour à la fois. Les jobs contenant une tâche de pipeline sont soumis aux limites de simultanéité suivantes :
- Un Job avec
max_concurrent_runs > 1qui contient une tâche de pipeline est limité à une seule exécution concurrente. L'interface utilisateur des jobs affiche un avis lorsque ce plafond est appliqué. - Une tâche de pipeline intégrée dans une tâche for-each est limitée à une itération concurrente, indépendamment de la concurrence configurée de la boucle.
Tenez compte de ces limites lors de la conception de pipelines paramétrés que vous avez l'intention d'exécuter avec de nombreuses combinaisons de parameter ou selon des calendriers serrés.
Planifier un pipeline avec l’interface utilisateur du pipeline
L'ajout d'une planification à un pipeline crée un job avec une seule tâche de pipeline. Vous ne pouvez configurer que les Trigger de planification basés sur le temps à l'aide de cette interface utilisateur. Pour plus d'options de Trigger avancées, consultez Configurer une tâche de pipeline avec l'interface utilisateur Jobs.
Configurez une tâche de pipeline dans un Job planifié à l'aide de l'interface utilisateur du pipeline en suivant les étapes ci-dessous :
-
Dans votre Workspace, cliquez
sur **Tâches et pipelines** dans la barre latérale.
-
Cliquez sur le Nom du pipeline. L’interface utilisateur du pipeline apparaît.
-
Cliquez sur **Planifier**.
- S'il n'existe pas de calendrier pour le pipeline, la boîte de dialogue **Nouveau calendrier** apparaît.
- Si un ou plusieurs plannings existent déjà, cliquez sur Ajouter un planning .
-
Saisissez un nom unique pour le Job dans le champ **Nom du Job**.
-
(Facultatif) Mettre à jour la fréquence de la planification.
- Sélectionnez **Advanced** pour plus d'options détaillées, y compris la syntaxe cron.
-
(Facultatif) Sous Plus d'options , configurez une ou plusieurs adresses e-mail pour recevoir des alertes en cas de start, de succès ou d'échec du pipeline.
-
Cliquez sur Créer .
Si le pipeline est inclus dans un ou plusieurs jobs planifiés, le bouton Planifier affiche le nombre de planifications existantes, par exemple, Planifier (5).
Ajoutez une planification à une vue matérialisée ou une table de streaming dans Databricks SQL
Les vues matérialisées et les tables de streaming définies dans Databricks SQL prennent en charge la planification basée sur le temps spécifiée dans les commandes CREATE ou ALTER.
Pour plus de détails, consultez les articles suivants :