Pular para o conteúdo principal

Testar um agente com a interface do usuário de chat

O MLflow Review App inclui um chat integrado interface que permite aos especialistas do domínio testar interativamente seu agente e fornecer feedback imediato. Use a interface de bate-papo como uma forma de verificar o clima do seu aplicativo.

importante

A IU do Review App Chat requer um agente implantado em um endpointde modelo instalado. Atualmente, não oferece suporte a agentes implantados em Databricks Apps. Se você implantou seu agente no Databricks Apps, ainda pode rotular os rastreamentos existentes para avaliação. Databricks está integrando suporte para avaliações e feedback diretamente no chatbot Padrão.

Revise a interface do bate-papo do aplicativo

Quando usar os testes de interface de chat

O teste de interface de chat é ideal quando você deseja:

  • Teste fluxos de conversa e interações de múltiplas etapas com especialistas da área.
  • Reúna feedback de especialistas sobre as respostas e o comportamento dos candidatos.
  • Valide as atualizações em um ambiente seguro antes da implementação em produção.

Pré-requisitos

  • MLflow e o pacote necessário devem estar instalados. O recurso descrito neste guia requer a versão 3.1.0 MLflow ou acima. Execute o seguinte comando para instalar ou atualizar o SDK MLflow , incluindo os extras necessários para a integração Databricks :

    Bash
    pip install --upgrade "mlflow[databricks]>=3.1.0" openai "databricks-connect>=16.1"
  • Seu ambiente de desenvolvimento deve estar conectado ao Experimento do MLflow onde os rastreamentos do seu agente são registrados.

  • Especialistas de domínio devem ter todos os itens a seguir para usar a interface de chat do aplicativo de avaliação:

    • Account provisionamento : O revisor deve ser provisionado na sua account do Databricks. Os administradores da account podem usar o provisionamento SCIM em nível de account para sincronizar usuários do seu provedor de identidade ou registrar manualmente usuários e grupos. Consulte Gerenciamento de usuários e grupos para obter detalhes.
    • Direito de acesso ao workspace : o revisor deve ter o direito de acesso ao Workspace para o workspace que hospeda o experimento. O Review App é carregado por meio de rotas de IU do workspace que exigem esse direito, portanto, apenas o provisionamento de account não é suficiente. Consulte Atribuir um usuário a um workspace para atribuir direitos.
    • Acesso ao endpoint : permissão CAN_QUERY no endpoint do servindo modelo.

Configure e colete feedback com a interface de chat.

A IU de chat do MLflow Review App conecta-se a uma versão implantada do seu agente, permitindo que especialistas do domínio conversem com o seu aplicativo e forneçam feedback imediato. Siga estas etapas para configurar a IU de chat e coletar feedback:

  1. Empacote seu aplicativo usando Agentes Personalizados e implante-o usando Deploy on Apps como um endpoint de Model Serving.

  2. Adicione o endpoint ao aplicativo de revisão do seu experimento:

nota

O exemplo abaixo adiciona um LLM hospedado no Databricks ao aplicativo de revisão. Substitua o endpoint pelo endpoint do seu aplicativo da etapa 1.

Python
from mlflow.genai.labeling import get_review_app

# Get review app for current MLflow experiment
review_app = get_review_app()

# Connect your deployed agent endpoint
review_app.add_agent(
agent_name="claude-sonnet",
model_serving_endpoint="databricks-claude-sonnet-4-5",
)

print(f"Share this URL: {review_app.url}/chat")
  1. Após a configuração, compartilhe o URL do aplicativo de avaliação com seus especialistas de domínio. Eles poderão:
  • Acesse a interface de bate-papo através do navegador da web.
  • Interaja com o aplicativo digitando perguntas.
  • Forneça feedback após cada resposta usando os controles de feedback integrados.
  • Continue a conversa para testar várias interações.

Análise da renderização do conteúdo do aplicativo

A interface de chat utiliza consultas de especialistas no domínio como entrada, respostas de agentes endpoint real como saída e armazena os resultados em rastreamentos MLflow . Não é necessário fornecer um esquema de rótulos personalizado, pois essa abordagem utiliza perguntas de feedback fixas.

O aplicativo Review renderiza automaticamente diferentes tipos de conteúdo a partir do seu rastreamento MLflow:

  • Documentos recuperados : Os documentos dentro de um intervaloRETRIEVER são renderizados para exibição.

  • Mensagens no formato OpenAI : Entradas e saídas do MLflow Trace, seguindo as conversas do chat OpenAI, são renderizadas:

  • Dicionários : As entradas e saídas do MLflow Trace que são dicionários são renderizadas como JSONs formatados.

Caso contrário, o conteúdo de input e output do intervalo raiz de cada traço é usado como conteúdo primário para revisão.

Ver comentários do chat

Todas as interações e feedbacks coletados por meio da interface de chat são capturados automaticamente como registros no MLflow.

Para view os registros das interações de bate-papo:

  1. Navegue até a interface do usuário do MLflow.
  2. Encontre o experimento associado à sua sessão do aplicativo Review.
  3. Navegue pelos rastros para ver o histórico completo da conversa.
  4. Analise o feedback associado a cada resposta.

Próximos passos

Next o passo: Evaluation dataset reference