Pular para o conteúdo principal

Spark Declarative Pipelines

O Apache Spark™ Declarative Pipelines é uma estrutura declarativa para construir pipelines de dados em lotes e em transmissão em SQL e Python. LakeFlow Pipelines estendem e são interoperáveis com o Spark Declarative Pipelines, enquanto são executados no Databricks Runtime otimizado para desempenho. Os casos de uso comuns para pipelines incluem ingestão de dados de fontes como armazenamento em nuvem (como Amazon S3, Azure ADLS Gen2 e Google Cloud Storage) e barramentos de mensagens (como Apache Kafka, Amazon Kinesis, Google Pub/Sub, Azure EventHub e Apache Pulsar), além de transformações incrementais em lotes e streaming.

Esta seção fornece informações detalhadas sobre como usar pipelines. Os tópicos a seguir ajudam você a começar.

tópico

Descrição

Conceitos de Pipeline

Saiba mais sobre os conceitos de alto nível de pipelines, incluindo fluxos, tabelas de transmissão e visualizações materializadas.

Tutoriais

Siga o tutorial para obter experiência prática no uso do pipeline.

Desenvolver pipelines

Aprenda a desenvolver e testar pipelines que criam fluxos para ingestão e transformação de dados.

Configurar pipeline

Aprenda a programar e configurar pipeline.

Monitorar pipelines

Aprenda a monitorar seu pipeline e solucionar problemas de consultas pipeline .

Desenvolvedores

Aprenda a usar Python e SQL no desenvolvimento de pipelines.

Pipelines autônomos

Saiba como criar tabelas de transmissão autônomas e visualizações materializadas no Databricks SQL ou Python.

Práticas recomendadas

Aprenda padrões recomendados para construir um pipeline confiável, eficiente e de fácil manutenção.

tópico

Descrição

Conceitos de Pipeline

Saiba mais sobre os conceitos de alto nível de pipelines, incluindo fluxos, tabelas de transmissão e visualizações materializadas.

Tutoriais

Siga o tutorial para obter experiência prática no uso do pipeline.

Desenvolver pipelines

Aprenda a desenvolver e testar pipelines que criam fluxos para ingestão e transformação de dados.

Configurar pipeline

Aprenda a programar e configurar pipeline.

Monitorar pipelines

Aprenda a monitorar seu pipeline e solucionar problemas de consultas pipeline .

Desenvolvedores

Aprenda a usar Python e SQL no desenvolvimento de pipelines.

Pipelines autônomos

Saiba como criar tabelas de transmissão autônomas e visualizações materializadas no Databricks SQL ou Python.

Práticas recomendadas

Aprenda padrões recomendados para construir um pipeline confiável, eficiente e de fácil manutenção.

Recursos adicionais

Nesta página