Spark Declarative Pipelines
O Apache Spark™ Declarative Pipelines é uma estrutura declarativa para construir pipelines de dados em lotes e em transmissão em SQL e Python. LakeFlow Pipelines estendem e são interoperáveis com o Spark Declarative Pipelines, enquanto são executados no Databricks Runtime otimizado para desempenho. Os casos de uso comuns para pipelines incluem ingestão de dados de fontes como armazenamento em nuvem (como Amazon S3, Azure ADLS Gen2 e Google Cloud Storage) e barramentos de mensagens (como Apache Kafka, Amazon Kinesis, Google Pub/Sub, Azure EventHub e Apache Pulsar), além de transformações incrementais em lotes e streaming.
Esta seção fornece informações detalhadas sobre como usar pipelines. Os tópicos a seguir ajudam você a começar.
tópico | Descrição |
|---|---|
Saiba mais sobre os conceitos de alto nível de pipelines, incluindo fluxos, tabelas de transmissão e visualizações materializadas. | |
Siga o tutorial para obter experiência prática no uso do pipeline. | |
Aprenda a desenvolver e testar pipelines que criam fluxos para ingestão e transformação de dados. | |
Aprenda a programar e configurar pipeline. | |
Aprenda a monitorar seu pipeline e solucionar problemas de consultas pipeline . | |
Aprenda a usar Python e SQL no desenvolvimento de pipelines. | |
Saiba como criar tabelas de transmissão autônomas e visualizações materializadas no Databricks SQL ou Python. | |
Aprenda padrões recomendados para construir um pipeline confiável, eficiente e de fácil manutenção. |