Monitorar a integridade do job (Pré-visualização privada)
Visualização
Este recurso está na Prévia privada. Para solicitar acesso, entre em contato com sua equipe de account Databricks.
A integridade de Jobs do LakeFlow é uma pontuação única e agregada que ajuda a identificar Jobs que precisam de atenção sem verificar vários sinais em diferentes lugares. A pontuação de integridade combina o status da execução, a taxa de falha, os avisos definidos pelo usuário, os avisos automatizados e (opcionalmente) os sinais de qualidade dos dados em um único indicador na lista Jobs & Pipelines e na página do Job.
Este artigo descreve como usar a integridade do Job para:
- Filtre a lista Jobs & Pipelines para exibir jobs degradados.
- Leia o resumo de integridade de um Job para entender por que ele está degradado.
- Priorizar jobs pela sua pontuação de impacto.
- Acione o Genie Code para ajudar a depurar o problema.
- Ativar monitoramento da qualidade de dados para que a pontuação de integridade reflita a completude e a atualização em nível de tabela.
Como a integridade de Jobs funciona
A pontuação de integridade do Job reflete o status mais grave em todos os critérios de integridade. Os status, do mais ao menos grave, são:
- **Não íntegro**: Pelo menos um critério não está íntegro.
- Aviso : Pelo menos um critério está em estado de aviso e nenhum critério está comprometido.
- **Íntegro**: Nenhum critério é sinalizado.
A saúde do job é mostrada apenas para jobs com execuções recentes. Se um job não foi executado nos últimos aproximadamente dois meses, a coluna de saúde fica em branco. A saúde do job não se aplica a pipelines, então a coluna também fica em branco para pipelines durante esta prévia.
Critérios de integridade
Os critérios a seguir são avaliados ao final de cada execução ou, para sinais de qualidade de dados, assincronamente após a conclusão da execução:
Categoria | Critério | Status quando acionado | Descrição |
|---|---|---|---|
Falhas de Job | Status da última execução | Mau estado de funcionamento | A última execução falhou após todas as tentativas. |
Falhas de Job | Taxa de falha | Aviso | Mais de 50% das últimas 25 execuções falharam. |
Aviso definido pelo usuário | Limite de métrica | Aviso | Um limite configurado pelo usuário para duração de execução ou backlog de transmissão é excedido. |
Aviso automatizado | DBR desatualizado | Aviso | O Job é executado em uma versão do Databricks Runtime que está se aproximando do fim da vida útil. |
Aviso automatizado | Anomalia de duração | Aviso | A duração da execução é mais de dois desvios padrão da média das últimas 25 execuções bem-sucedidas. Requer pelo menos três execuções bem-sucedidas. |
Qualidade dos dados | Qualidade dos dados | Mau estado de funcionamento | Agrega a integridade e atualidade no nível da tabela da detecção de anomalia no monitoramento da qualidade dos dados. O pior indicador disponível no nível da tabela é exibido. Sinais de perfil de dados não estão incluídos. |
A qualidade dos dados é avaliada apenas quando o monitoramento é habilitado no nível do esquema. Consulte Ativar o monitoramento da qualidade de dados para um Job.
Identificar Jobs problemáticos
Para encontrar jobs que precisam de atenção, use o filtro **Saúde** na lista **Jobs e pipelines**.
- Na barra lateral, clique
em **Jobs e Pipelines**.
- Utilize o filtro Integridade para selecionar Não íntegro , Aviso ou ambos.
A coluna **Saúde** aparece à esquerda da coluna de execuções recentes. Jobs que estão com problemas de saúde ou em estado de aviso são exibidos no topo da lista filtrada, para que você possa priorizar o que investigar primeiro.
Trabalhos que não tiveram execuções recentes e pipelines têm uma coluna **Saúde** em branco e são excluídos dos resultados do filtro **Saúde**.
Entenda a integridade de um job em um relance
Abra um job na lista **Jobs e Pipelines** para ver seu resumo de integridade. O resumo mostra quais critérios são sinalizados, quanto tempo o job está em seu estado atual e uma breve explicação para cada critério degradado.
- Se o Job estiver em **Mau estado de funcionamento** ou em **Alerta**, a seção de integridade é expandida por default.
- Se o job estiver **Saudável**, a seção é recolhida. Expanda-o para ver os critérios que foram avaliados.
Cada critério degradado pode ser expandido para visualizar mais detalhes e, quando relevante, fornece links cruzados para outras partes do produto (por exemplo, a lista de execuções para taxa de falha, ou a página de monitoramento da qualidade dos dados para uma tabela sinalizada) para que você possa aprofundar-se no sinal subjacente.
Triagem com a pontuação de impacto
O impacto indica a importância de um job, para que você possa priorizar entre jobs com problemas. Ele é baseado no volume de consultas downstream das tabelas que o job produz: quanto mais essas tabelas são consultadas, maior o impacto. O impacto é agregado a partir do nível da tabela, portanto, uma única tabela de alto impacto torna todo o job de alto impacto.
Impacto | Quando se aplica |
|---|---|
Alta | Pelo menos uma tabela na linhagem do job é de alto impacto. |
Médio | Nenhuma tabela é de alto impacto e pelo menos uma tabela é de médio impacto. |
Baixa | Nenhuma tabela tem impacto alto ou médio, ou não há dados de linhagem disponíveis para o job. |
Desconhecido | O Job não foi executado recentemente, portanto, o impacto ainda não foi determinado. |
A pontuação de impacto está disponível nas seguintes regiões: us-east-1, us-east-2, us-west-2, eu-west-1, eu-central-1 e ap-southeast-2.
Depure um Job problemático com o Genie Code
No resumo de integridade, você pode passar para o Genie Code para investigar o Job degradado.
Clique em Diagnosticar para abrir um chat onde você pode pedir ao Genie Code para investigar e aplicar correções. Ele lê o resumo da saúde, produz uma explicação do porquê o Job está degradado e permite continuar a conversa para aprofundar ou aplicar alterações direcionadas após a confirmação.
O Genie Code usa a pontuação de integridade como seu ponto de entrada e, em seguida, consulta informações relacionadas ao job e à qualidade dos dados para identificar a causa raiz do problema. Para saber mais sobre as funcionalidades subjacentes, consulte Genie Code. Esta página descreve apenas como iniciar o Genie Code a partir do resumo de integridade.
Ativar o monitoramento da qualidade dos dados para um Job
A qualidade dos dados é incluída na pontuação de integridade apenas se o monitoramento estiver ativado para os esquemas nos quais o job grava. Ativar monitoramento na página do job:
- Abra o job da lista **Jobs e pipelines**.
- Na barra lateral, selecione **Configuração de Integridade do Job**.
- Na seção **Monitoramento da qualidade de dados**, clique em **Habilitar monitoramento**.
- Revise a lista de esquemas para os quais o Job grava, classificados pelo número de tabelas em cada esquema.
- Confirme a seleção e clique em Ativar monitoramento .
Depois que o monitoramento é ativado, os sinais de qualidade dos dados aparecem no resumo de integridade do job assim que a primeira avaliação de qualidade é concluída. O status de integridade é atualizado sempre que novos resultados de qualidade de dados estiverem disponíveis.
Os sinais de qualidade dos dados não são avaliados em tempo real. Pode haver um atraso entre o momento em que a execução de um job é concluída e o momento em que seus resultados de qualidade dos dados aparecem no resumo de integridade. A frequência de varredura é determinada pela detecção de anomalia. Para obter detalhes, consulte Detecção de anomalia.
A qualidade dos dados é configurada no nível do esquema.
Limitações
- Pipelines não são compatíveis e têm um status de integridade em branco.
- As opções de configuração de integridade (por exemplo, a exclusão de critérios específicos) não estão disponíveis. Para enviar feedback sobre critérios ruidosos, entre em contato com sua equipe de conta Databricks.
- Não é possível substituir manualmente o status de integridade de um job.
- A pontuação de saúde não é persistida nas tabelas do sistema.
- A integridade é avaliada no final de cada execução de Job. Se uma execução agendada for perdida (o Job não for executado), o status de integridade não será atualizado até que o Job seja executado novamente, mesmo que o monitoramento da qualidade dos dados detecte uma anomalia nesse meio tempo.