Pular para o conteúdo principal

O que são observabilidade e qualidade de agentes?

dica

Usando um agente de programação?

If you use a coding agent such as Claude Code, Cursor, VS Code, or OpenCode, install our skills so it can work with MLflow effectively:

Bash
uvx mlflow agent setup

Isso configura a tab do agente de programação que você verá nas tarefas ao longo desta documentação. Consulte Configurar um agente de programação e Configurar o servidor MCP do MLflow.

A observabilidade e a qualidade de agentes são a prática de medir, depurar e aprimorar seu agente de AI desde o primeiro rastreamento até a produção. No Databricks, você faz isso com o MLflow . O MLflow no Databricks é o MLflow — o mesmo produto de código aberto, apenas gerenciado e integrado à plataforma Databricks, para que seus rastreamentos, avaliações e prompts fiquem no Unity Catalog junto com o resto dos seus dados.

Começar com rastreamentos

O rastreamento de agentes captura um registro completo de cada execução de agente. Um rastreamento inclui a entrada inicial e a saída final, além de cada etapa intermediária — como chamadas de modelo, chamadas de ferramenta e recuperação — com as entradas, saídas, latência, uso de tokens e custo de cada etapa.

Tracing is the foundation for agent observability and quality. It lets you analyze how people use your agent and where it spends time and money. More importantly, it gives you the evidence required to improve an agent. With only an input and final response, you cannot tell which intermediate decision caused a failure. With traces, you can inspect every step, diagnose the problem, collect feedback in context, and turn representative failures into evaluation and golden datasets.

Você usa rastreamentos para:

  • Analise o uso de agentes, a latência, o consumo de tokens e o custo.
  • Depure falhas em chamadas de modelo, recuperação e uso de ferramentas.
  • Colete feedback humano no contexto da execução que está sendo revisada.
  • Construa datasets de avaliação e de referência a partir de falhas de produção representativas.
  • Execute avaliações e monitore a qualidade em produção.

O ciclo de qualidade

Melhorar um agente não é uma etapa única — é um loop que você executa continuamente. Cada passada corrige um problema e revela o próximo.

O ciclo de qualidade do agente: rastrear, encontrar um problema, coletar feedback e com certeza curar um dataset, escrever um avaliador, corrigir o agente, avaliar e monitorar a produção — o que revela o próximo problema.

  1. Rastreie seu agente. Instrumente seu agente para que cada execução seja capturada como um rastreamento — a evidência da qual cada etapa posterior depende.
  2. Encontrar um problema. Identifique uma falha nos seus rastreamentos de desenvolvimento ou detecte uma regressão na produção.
  3. Collect feedback and curate a dataset. Review the failing traces with developers, domain experts, or users. Record feedback on the trace so it stays connected to the execution being reviewed, then turn representative failures and known-good examples into an evaluation or golden dataset.
  4. Escreva um avaliador. Defina um avaliador (um juiz de LLM ou uma verificação baseada em código) que detecte o problema automaticamente.
  5. Corrija o agente. Processe a iteração no seu prompt ou agente para resolver a causa raiz.
  6. Avalie a correção. Execute novamente a avaliação em relação ao seu dataset para confirmar a correção — e garanta que nada mais foi quebrado.
  7. Monitore a produção. Execute seus avaliadores em tráfego real para que o problema não ocorra novamente — o que revela o próximo a ser corrigido.

A jornada

Start at the top if you're new; jump to a stage if you already know where you are.

    • Instrumente seu agente
    • Adicione rastreamento para capturar cada entrada, passo e saída. Os rastreamentos são armazenados no Unity Catalog (recomendado) — com governança, consultáveis via SQL e a base de dados para tudo o resto.
    • Observar e & encontrar problemas de agentes
    • Explore rastreamentos na interface do usuário e faça perguntas em linguagem natural com o Genie Code — sem necessidade de SQL. Agrupe rastreamentos para identificar modos de falha recorrentes e encontrar problemas mais rapidamente.
    • Avaliar & melhorar a qualidade
    • Execute avaliações com avaliadores integrados e personalizados e, em seguida, faça iterações em seu prompt e agente para corrigir o que encontrou.
    • Monitorar em produção
    • Avalie o tráfego em tempo real continuamente para identificar regressões e detectar novos problemas antes que seus usuários o façam.

Prefere trabalhar em uma tarefa por vez? Navegue pelas receitas de observabilidade de agentes para obter guias focados e prontos para uso — desde a configuração de um agente de codificação até a criação de juízes LLM personalizados.

Próximo passo

Pronto para começar o loop? Instrumente seu agente para capturar seus primeiros rastreamentos.