Pular para o conteúdo principal

Spark Declarative Pipelines

O Apache Spark™ Declarative Pipelines é uma estrutura declarativa para construir pipelines de dados em lotes e em transmissão em SQL e Python. LakeFlow Pipelines estendem e são interoperáveis com o Spark Declarative Pipelines, enquanto são executados no Databricks Runtime otimizado para desempenho. Os casos de uso comuns para pipelines incluem ingestão de dados de fontes como armazenamento em nuvem (como Amazon S3, Azure ADLS Gen2 e Google Cloud Storage) e barramentos de mensagens (como Apache Kafka, Amazon Kinesis, Google Pub/Sub, Azure EventHub e Apache Pulsar), além de transformações incrementais em lotes e streaming.

Esta seção fornece informações detalhadas sobre como usar pipelines. Os tópicos a seguir ajudam você a começar.

    • Como usar LakeFlow Pipelines
    • Comece aqui. Entenda como usar pipelines ao longo de seu ciclo de vida, e por que, com links para as tarefas em cada etapa.
    • Conceitos de Pipeline
    • Saiba mais sobre os conceitos de alto nível de pipelines, incluindo fluxos, tabelas de transmissão e visualizações materializadas.

Para obter informações mais detalhadas sobre pipelines, consulte:

    • Tutoriais
    • Siga o tutorial para obter experiência prática no uso do pipeline.
    • Desenvolver pipelines
    • Aprenda a desenvolver e testar pipelines que criam fluxos para ingestão e transformação de dados.
    • Monitorar pipelines
    • Aprenda a monitorar seu pipeline e solucionar problemas de consultas pipeline .
    • Desenvolvedores
    • Aprenda a usar Python e SQL no desenvolvimento de pipelines.
    • Pipelines autônomos
    • Saiba como criar tabelas de transmissão autônomas e visualizações materializadas no Databricks SQL ou Python.
    • Práticas recomendadas
    • Aprenda padrões recomendados para construir um pipeline confiável, eficiente e de fácil manutenção.

Recursos adicionais

Nesta página