Modo de pipeline Trigger versus modo contínuo
Os modos de pipeline acionado e contínuo controlam como um pipeline processa os dados: o modo acionado atualiza os dados disponíveis e para, enquanto o modo contínuo mantém as tabelas atualizadas à medida que novos dados chegam. Para cargas de trabalho que exigem latência de milissegundos, consulte Usar o modo em tempo real em LakeFlow Pipelines.
Pipeline mode is independent of the type of table being computed. Both materialized views and streaming tables can be updated in either pipeline mode.
As operações de refresh para visualizações materializadas independentes e tabelas de transmissão são sempre executadas usando o modo de pipeline Trigger.
O que é o modo de pipeline Trigger?
Se o pipeline usar o modo Trigger , o sistema para após atualizar todas as tabelas com base nos dados disponíveis no momento em que a atualização foi começada.
O que é o modo de pipeline contínuo?
If the pipeline uses continuous execution, it processes new data as it arrives in data sources to keep tables throughout the pipeline fresh.
Para evitar processamento desnecessário no modo de execução contínua, os pipelines monitoram automaticamente as tabelas Delta dependentes e realizam uma atualização apenas quando o conteúdo dessas tabelas dependentes é alterado.
Selecione um modo de pipeline de dados
The following table highlights the differences between triggered and continuous pipeline modes:
Key questions | Acionado | Contínuo |
|---|---|---|
Quando a atualização termina? | Automaticamente quando concluído. | Runs continuously until manually stopped. |
Quais dados são processados? | Data available when the update starts. | All data as it arrives at configured sources. |
What data freshness requirements is this best for? | Data updates run every 10 minutes, hourly, or daily. | Data updates are desired between every 10 seconds and a few minutes. |
Pipelines acionados podem reduzir o consumo de recursos e despesas, pois o cluster é executado apenas pelo tempo necessário para atualizar o pipeline. No entanto, novos dados não são processados até que o pipeline seja acionado. Pipelines contínuos exigem um cluster em execução, o que é mais caro, mas reduz a latência de processamento.
Executar um pipeline contínuo com um job contínuo
O Databricks recomenda executar pipelines contínuos com um job contínuo em vez de definir o valor de Pipeline mode como contínuo. Quando um job contínuo orquestra um pipeline, o job gerencia o ciclo de vida de execução do pipeline e desbloqueia modos de desempenho serverless, como o modo Standard, que o modo contínuo integrado do pipeline não suporta.
A orquestração de Job controla o modo de execução apenas para LakeFlow Pipelines. Views materializadas e tabelas de transmissão autônomas sempre são executadas no modo triggered, independentemente da orquestração de jobs.
When a job orchestrates a pipeline, the job determines the execution mode and takes precedence over the pipeline's Pipeline mode setting. A continuous job runs its pipeline continuously even if the pipeline's Pipeline mode is triggered, and a triggered or scheduled job runs its pipeline as a single update even if the pipeline's Pipeline mode is continuous.
Como o Job substitui a configuração de modo do pipeline, defina o Modo de pipeline como Trigger (o default) ao envolvê-lo em um Job contínuo. Isso evita comportamentos inesperados se o pipeline for executado fora do job.
To configure a continuous job for a pipeline, see Run a pipeline continuously with a continuous job.
Executar um pipeline com o modo contínuo integrado
A configuração contínua integrada do pipeline não está sendo removida, mas o Databricks desencoraja seu uso para novos pipelines em favor do padrão de job contínuo. Para alternar entre Trigger e contínuo, use a opção Modo do pipeline nas configurações do pipeline ao criar ou editar um pipeline. Consulte Configurar pipelines.
Set trigger interval for continuous pipelines
When configuring pipelines for continuous mode, you can set trigger intervals to control how frequently the pipeline starts an update for each flow. The trigger interval is a pipeline configuration that applies whether the pipeline runs in continuous mode through its own Pipeline mode setting or through a continuous job.
Você pode usar pipelines.trigger.interval para controlar o intervalo de trigger para um fluxo que atualiza uma tabela ou um pipeline inteiro. Como um pipeline acionado processa cada tabela uma única vez, o pipelines.trigger.interval é usado apenas com pipelines contínuos. O Databricks recomenda defini-lo em tabelas individuais, porque as queries de streaming e de lotes têm defaults diferentes. Defina o valor em um pipeline apenas quando o processamento exigir o controle de atualizações para todo o gráfico do pipeline.
Para os valores default por tipo de fluxo e exemplos de configuração de pipelines.trigger.interval em SQL, Python e na configuração do pipeline, consulte Intervalo de trigger de pipelines.