Pular para o conteúdo principal

Avalie e melhore

dica

Início rápido do agente de código

Usando um agente de programação? Cole este prompt:

Read the documentation at https://docs.databricks.com/aws/en/mlflow3/genai/eval-monitor and set up evaluation for my agent using scorers and an evaluation dataset.

Opcionalmente, instale mlflow/skills para uma integração mais profunda com o MLflow.

A avaliação mede se o seu agente é realmente bom — a resposta está correta, fundamentada, segura e completa? O MLflow pontua seus rastreios com pontuadores : juízes de LLM e verificações baseadas em código que anexam uma avaliação de qualidade a cada rastreio. Comece pontuando alguns rastreios na interface do usuário e, em seguida, mova os mesmos pontuadores para um loop mlflow.genai.evaluate() repetível à medida que seu aplicativo amadurece.

Visão geral rápida: pontuar rastreamentos na interface do usuário

Avalie os rastreamentos que você já tem, sem código:

  1. Na Traces tab, selecione alguns rastreamentos usando as caixas de seleção de linha.

  2. Clique em Actions e escolha Evaluate .

    Selecione rastreios, escolha Ações e depois Avaliar.

  3. Na caixa de diálogo Run scorer , escolha um ou mais avaliadores: escolha entre os avaliadores de LLM como juiz pré-construídos (como Correção, Completude e Fluência), reutilize um de seus Avaliadores registrados ou clique em Create scorer .

    Caixa de diálogo de execução do avaliador que lista os avaliadores LLM como juiz pré-construídos.

  4. Clique em Executar avaliador . O MLflow executa os avaliadores nos rastreamentos selecionados, anexa cada resultado ao seu rastreamento como feedback e registra a execução na aba Evaluation runs .

Esta é a mesma pontuação que impulsiona a avaliação programática — os juízes que você escolhe aqui são os juízes de LLM integrados, e os resultados são gravados como rastreios com feedback de pontuação no seu experimento.

Próximas etapas