Testar um agente com a interface do usuário de chat
O MLflow Review App inclui um chat integrado interface que permite aos especialistas do domínio testar interativamente seu agente e fornecer feedback imediato. Use a interface de bate-papo como uma forma de verificar o clima do seu aplicativo.
A IU do Review App Chat requer um agente implantado em um endpointde modelo instalado. Atualmente, não oferece suporte a agentes implantados em Databricks Apps. Se você implantou seu agente no Databricks Apps, ainda pode rotular os rastreamentos existentes para avaliação. Databricks está integrando suporte para avaliações e feedback diretamente no chatbot Padrão.

Quando usar os testes de interface de chat
O teste de interface de chat é ideal quando você deseja:
- Teste fluxos de conversa e interações de múltiplas etapas com especialistas da área.
- Reúna feedback de especialistas sobre as respostas e o comportamento dos candidatos.
- Valide as atualizações em um ambiente seguro antes da implementação em produção.
Pré-requisitos
-
MLflow e o pacote necessário devem estar instalados. O recurso descrito neste guia requer a versão 3.1.0 MLflow ou acima. Execute o seguinte comando para instalar ou atualizar o SDK MLflow , incluindo os extras necessários para a integração Databricks :
Bashpip install --upgrade "mlflow[databricks]>=3.1.0" openai "databricks-connect>=16.1" -
Seu ambiente de desenvolvimento deve estar conectado ao Experimento do MLflow onde os rastreamentos do seu agente são registrados.
- Siga O que é observabilidade e qualidade de agentes? para conectar seu ambiente de desenvolvimento.
-
Especialistas de domínio devem ter todos os itens a seguir para usar a interface de chat do aplicativo de avaliação:
- Account provisionamento : O revisor deve ser provisionado na sua account do Databricks. Os administradores da account podem usar o provisionamento SCIM em nível de account para sincronizar usuários do seu provedor de identidade ou registrar manualmente usuários e grupos. Consulte Gerenciamento de usuários e grupos para obter detalhes.
- Direito de acesso ao workspace : o revisor deve ter o direito de acesso ao Workspace para o workspace que hospeda o experimento. O Review App é carregado por meio de rotas de IU do workspace que exigem esse direito, portanto, apenas o provisionamento de account não é suficiente. Consulte Atribuir um usuário a um workspace para atribuir direitos.
- Acesso ao endpoint : permissão CAN_QUERY no endpoint do servindo modelo.
Configure e colete feedback com a interface de chat.
A IU de chat do MLflow Review App conecta-se a uma versão implantada do seu agente, permitindo que especialistas do domínio conversem com o seu aplicativo e forneçam feedback imediato. Siga estas etapas para configurar a IU de chat e coletar feedback:
-
Empacote seu aplicativo usando Agentes Personalizados e implante-o usando Deploy on Apps como um endpoint de Model Serving.
-
Adicione o endpoint ao aplicativo de revisão do seu experimento:
O exemplo abaixo adiciona um LLM hospedado no Databricks ao aplicativo de revisão. Substitua o endpoint pelo endpoint do seu aplicativo da etapa 1.
from mlflow.genai.labeling import get_review_app
# Get review app for current MLflow experiment
review_app = get_review_app()
# Connect your deployed agent endpoint
review_app.add_agent(
agent_name="claude-sonnet",
model_serving_endpoint="databricks-claude-sonnet-4-5",
)
print(f"Share this URL: {review_app.url}/chat")
- Após a configuração, compartilhe o URL do aplicativo de avaliação com seus especialistas de domínio. Eles poderão:
- Acesse a interface de bate-papo através do navegador da web.
- Interaja com o aplicativo digitando perguntas.
- Forneça feedback após cada resposta usando os controles de feedback integrados.
- Continue a conversa para testar várias interações.
Análise da renderização do conteúdo do aplicativo
A interface de chat utiliza consultas de especialistas no domínio como entrada, respostas de agentes endpoint real como saída e armazena os resultados em rastreamentos MLflow . Não é necessário fornecer um esquema de rótulos personalizado, pois essa abordagem utiliza perguntas de feedback fixas.
O aplicativo Review renderiza automaticamente diferentes tipos de conteúdo a partir do seu rastreamento MLflow:
-
Documentos recuperados : Os documentos dentro de um intervalo
RETRIEVERsão renderizados para exibição. -
Mensagens no formato OpenAI : Entradas e saídas do MLflow Trace, seguindo as conversas do chat OpenAI, são renderizadas:
outputsque contêm um objeto ChatCompletions no formato OpenAIinputsou dicionáriosoutputsque contêm uma keymessagescom uma matriz de mensagens de bate-papo no formato OpenAI- Se a matriz
messagescontiver chamadas de ferramentas de formatação OpenAI, elas também serão renderizadas.
- Se a matriz
-
Dicionários : As entradas e saídas do MLflow Trace que são dicionários são renderizadas como JSONs formatados.
Caso contrário, o conteúdo de input e output do intervalo raiz de cada traço é usado como conteúdo primário para revisão.
Ver comentários do chat
Todas as interações e feedbacks coletados por meio da interface de chat são capturados automaticamente como registros no MLflow.
Para view os registros das interações de bate-papo:
- Navegue até a interface do usuário do MLflow.
- Encontre o experimento associado à sua sessão do aplicativo Review.
- Navegue pelos rastros para ver o histórico completo da conversa.
- Analise o feedback associado a cada resposta.
Próximos passos
- Aprenda como rotular rastros existentes para uma coleta de feedback mais sistemática.
- Explore a coleta de feedback do usuário final para aplicações de produção.
Next o passo: Evaluation dataset reference