エージェントの可観測性レシピ
一般的なエージェントのオブザーバビリティと品質のタスクに関するエンドツーエンドのレシピ — コーディングエージェントを接続し、評価して改善します。
コーディングエージェントを接続する
コーディングエージェントに MLflow の APIs に関する知識とトレースへのライブアクセスを提供し、IDE から正確な計測コードを記述し、エージェントに関する質問に回答できるようにします。
-
- コーディングエージェントのセットアップ
- MLflow スキルをインストールして、Claude Code、Cursor、VS Code、または OpenCode で正確なトレースおよび評価コードが生成されるようにします。
-
- MLflow MCPサーバーを設定する
- コーディング エージェントがトレースやエクスペリメントにアクセスできるように、MLflow MCP サーバーを構成します。
-
- コーディングエージェントからのトレースのクエリー
- IDE から離れることなく、MLflow MCP サーバーを使用してトレースの検索、調査、アノテーションを行います。
評価と改善
クイックなエンドツーエンドのウォークスルーから専用の LLM ジャッジまで、独自基準に対してエージェントをスコアリングします。
-
- エージェントの評価と改善
- 評価データセットで
mlflow.genai.evaluate()を実行してエージェントをエンドツーエンドでスコアリングし、バージョンを比較します。
-
- LLMジャッジガイドラインを作成する
- 合格/不合格の自然言語基準をスコアラーに変換します — 評価コードは必要ありません。
-
- カスタムジャッジを作成する
make_judge()を使用して専用のジャッジを構築します。これには、実行を分析するトレースベースのジャッジが含まれます。