Modo de pipeline Trigger versus modo contínuo
Os modos de pipeline acionado e contínuo controlam como um pipeline processa os dados: o modo acionado atualiza os dados disponíveis e para, enquanto o modo contínuo mantém as tabelas atualizadas à medida que novos dados chegam. Para cargas de trabalho que exigem latência de milissegundos, consulte Usar o modo em tempo real em LakeFlow Pipelines.
O modo de pipeline é independente do tipo de tabela que está sendo calculada. Tanto as visualizações materializadas quanto as tabelas de transmissão podem ser atualizadas em qualquer um dos modos de pipeline.
As operações de refresh para visualizações materializadas independentes e tabelas de transmissão são sempre executadas usando o modo de pipeline Trigger.
O que é o modo de pipeline Trigger?
Se o pipeline usar o modo Trigger , o sistema para após atualizar todas as tabelas com base nos dados disponíveis no momento em que a atualização foi começada.
O que é o modo de pipeline contínuo?
Se o pipeline usar execução contínua , ele processará novos dados à medida que chegarem às fontes de dados, mantendo as tabelas atualizadas em todo o pipeline.
Para evitar processamento desnecessário no modo de execução contínua, os pipelines monitoram automaticamente as tabelas Delta dependentes e realizam uma atualização apenas quando o conteúdo dessas tabelas dependentes é alterado.
Selecione um modo de pipeline de dados
A tabela a seguir destaca as diferenças entre os modos de Trigger e pipeline contínuo:
Questões-chave | Acionado | Contínuo |
|---|---|---|
Quando a atualização termina? | Automaticamente quando concluído. | Funciona continuamente até ser interrompido manualmente. |
Quais dados são processados? | Dados disponíveis quando a atualização começa. | Todos os dados conforme chegam às fontes configuradas. |
Para quais requisitos de atualização de dados isso é mais indicado? | As atualizações de dados são realizadas a cada 10 minutos, de hora em hora ou diariamente. | As atualizações de dados são desejadas entre cada 10 segundos e alguns minutos. |
Pipelines acionados podem reduzir o consumo de recursos e despesas, pois o cluster é executado apenas pelo tempo necessário para atualizar o pipeline. No entanto, novos dados não são processados até que o pipeline seja acionado. Pipelines contínuos exigem um cluster em execução, o que é mais caro, mas reduz a latência de processamento.
Executar um pipeline contínuo com um job contínuo
O Databricks recomenda executar pipelines contínuos com um job contínuo em vez de definir o valor de Pipeline mode como contínuo. Quando um job contínuo orquestra um pipeline, o job gerencia o ciclo de vida de execução do pipeline e desbloqueia modos de desempenho serverless, como o modo Standard, que o modo contínuo integrado do pipeline não suporta.
A orquestração de Job controla o modo de execução apenas para LakeFlow Pipelines. Views materializadas e tabelas de transmissão autônomas sempre são executadas no modo triggered, independentemente da orquestração de jobs.
Quando um job orquestra um pipeline, o job determina o modo de execução e tem precedência sobre a configuração de Modo do pipeline do pipeline. Um job contínuo executa seu pipeline continuamente, mesmo se o Modo do pipeline estiver definido como Trigger, e um job acionado ou agendado executa seu pipeline como uma atualização única, mesmo se o Modo do pipeline estiver definido como contínuo.
Como o Job substitui a configuração de modo do pipeline, defina o Modo de pipeline como Trigger (o default) ao envolvê-lo em um Job contínuo. Isso evita comportamentos inesperados se o pipeline for executado fora do job.
Para configurar um job contínuo para um pipeline, consulte Executar um pipeline continuamente com um job contínuo.
Executar um pipeline com o modo contínuo integrado
A configuração contínua integrada do pipeline não está sendo removida, mas o Databricks desencoraja seu uso para novos pipelines em favor do padrão de job contínuo. Para alternar entre Trigger e contínuo, use a opção Modo do pipeline nas configurações do pipeline ao criar ou editar um pipeline. Consulte Configurar pipelines.
Definir intervalo de trigger para pipelines contínuos
Ao configurar pipelines para o modo contínuo, você pode definir intervalos de Trigger para controlar a frequência com que o pipeline começa uma atualização para cada fluxo. O intervalo de Trigger é uma configuração de pipeline que se aplica independentemente de o pipeline ser executado no modo contínuo por meio de sua própria configuração de Pipeline mode ou por meio de um job contínuo.
Você pode usar pipelines.trigger.interval para controlar o intervalo de trigger para um fluxo que atualiza uma tabela ou um pipeline inteiro. Como um pipeline acionado processa cada tabela uma única vez, o pipelines.trigger.interval é usado apenas com pipelines contínuos. O Databricks recomenda defini-lo em tabelas individuais, porque as queries de streaming e de lotes têm defaults diferentes. Defina o valor em um pipeline apenas quando o processamento exigir o controle de atualizações para todo o gráfico do pipeline.
Para os valores default por tipo de fluxo e exemplos de configuração de pipelines.trigger.interval em SQL, Python e na configuração do pipeline, consulte Intervalo de trigger de pipelines.