Pular para o conteúdo principal

Criar pipelines com sdp-meta

O projeto sdp-meta do Databricks Labs fornece ferramentas para gerar pipelines a partir de metadados que você mantém.

nota

O projeto de código aberto sdp-meta, como todos os projetos na account GitHub databrickslabs, existe apenas para fins de exploração. A Databricks não oferece suporte nem fornece acordos de nível de serviço (SLAs) para ele. Não envie tíquetes de suporte da Databricks para problemas relacionados a este projeto. Em vez disso, registre um GitHub issue, que é revisado conforme o tempo permite.

O que é sdp-meta?

Os LakeFlow Pipelines permitem que você especifique uma tabela de forma declarativa e gere um fluxo em um pipeline que cria a tabela e a mantém atualizada à medida que os dados de origem mudam. No entanto, se sua organização tiver centenas de tabelas, gerar e gerenciar esses pipelines consome muito tempo e pode levar a práticas inconsistentes.

O projeto sdp-meta é uma estrutura de metaprogramação orientada a metadados projetada para funcionar com LakeFlow Pipelines. Esta estrutura permite a automação de pipelines de dados bronze e silver aproveitando metadados registrados em um conjunto de arquivos JSON e YAML. Em runtime, pipelines genéricos leem seus metadados e constroem dinamicamente os fluxos descritos neles. O processamento bronze e silver pode ser executado em pipelines separados ou juntos em um pipeline combinado. Você gera os metadados sobre seus pipelines, e o sdp-meta gera seus pipelines.

Com sua lógica centralizada em um só lugar (os metadados), seu sistema é mais rápido, reutilizável e mais fácil de manter.

nota

O projeto sdp-meta era anteriormente chamado de dlt-meta, em homenagem ao recurso mais antigo Delta Live Tables no Databricks. O Delta Live Tables foi substituído pelos Lakeflow pipelines, e o sdp-meta funciona com Lakeflow pipelines. Se você estiver atualizando uma instalação existente do dlt-meta, consulte o guia de migração na documentação do sdp-meta.

Benefícios do sdp-meta

Existem dois casos de uso principais para o sdp-meta:

  • Ingira e limpe um grande número de tabelas de forma simples.
  • Aplique padrões de engenharia de dados em vários pipelines e usuários.

Os benefícios de usar uma abordagem orientada a metadados incluem:

  • A manutenção de metadados pode ser feita sem conhecimento de código Python ou SQL.
  • Manter metadados, em vez do código, requer menos sobrecarga e reduz erros.
  • O código é gerado pelo sdp-meta, portanto, ele permanece consistente e possui menos código personalizado em pipelines e tabelas publicadas.
  • Você pode agrupar facilmente tabelas em pipelines dentro dos metadados, gerando o número de pipelines necessários para atualizar seus dados da maneira mais eficiente.

Como o sdp-meta funciona

A imagem a seguir mostra uma visão geral do sistema sdp-meta:

Visão geral do sdp-meta

  1. Você cria os arquivos de metadados como entrada para o sdp-meta, para especificar seus arquivos de origem e saídas, regras de qualidade e processamento necessário. Esses arquivos de integração podem ser escritos em JSON ou YAML.
  2. Você executa o job de integração do sdp-meta. O mecanismo compila os arquivos de integração em uma especificação de fluxo de dados, chamada DataflowSpec , e a armazena em tabelas Delta (bronze_dataflowspec e silver_dataflowspec) para uso posterior.
  3. Em runtime, um pipeline genérico lê o DataflowSpec e constrói dinamicamente o gráfico de processamento bronze. Ele lê seus dados de origem (arquivos, transmissões ou CDC) e aplica as expectativas de dados corretas para corresponder às suas regras de qualidade, gerando suas tabelas bronze e colocando em quarentena os registros que falham nessas regras.
  4. O processamento silver pode ser executado em um pipeline genérico separado, que é o default para os Pacotes de Automação Declarativa, ou no mesmo pipeline quando você usa o modo combinado. O pipeline usa a DataflowSpec para aplicar as transformações apropriadas e outros processamentos, gerando tabelas silver que são limpas, enriquecidas e prontas para a analítica.

Você executa os pipelines gerados pelo sdp-meta para manter a saída atualizada à medida que seus dados de origem são atualizados.

Introdução

Para usar o sdp-meta, você deve:

  • Implante e configure a solução sdp-meta.
  • Prepare os metadados para suas tabelas das camadas bronze e silver.
  • Crie um job para integrar os metadados.
  • Use os metadados para criar pipelines para suas tabelas.

O projeto sdp-meta oferece suporte a várias interfaces de implantação: bundles (recomendado), uma CLI interativa, um Databricks App com GUI baseada em navegador, um servidor MCP para configuração assistida por IA e um Agent Skill portátil para agentes de IA com reconhecimento de habilidades.

A documentação do sdp-meta no GitHub tem um tutorial para ajudá-lo a começar com este processo. Para obter mais informações, consulte como começar com o sdp-meta no GitHub.

Outros recursos