メインコンテンツまでスキップ

エージェントの観測性と評価のための Genie Code

Genie Codeを使用すると、MLflow内でエージェントの理解、デバッグ、改善を行うための自然言語インターフェイスを利用できます。トレース、プロンプト、データセットから評価ラン、スコアラー、ラベリングセッションに至るまで、エクスペリメント内のすべてのものに対する読み取りアクセス権を持っているため、クエリーを書いたり複数のUIページを移動したりすることなく、可観測性と評価データを対話形式で探索できます。

まず、エクスペリメントの表示中にワークスペースの右上にあるGenie Code アイコンをクリックします。

エージェントの観測性と評価のための Genie Code

機能

Genie Code は、次のような幅広い観測および評価タスクに役立ちます。

  • トレースの分析とデバッグ : 失敗したトレースを調査し、エラーを見つけ、スパン ツリーを調べ、根本原因を特定し、レイテンシを分析し、エージェントの実行フローのボトルネックを特定します。あらゆるトレースを詳細に調査し、各ステップの入力、出力、メタデータ、トークンの使用状況など、その全範囲の階層を検査します。
  • メトリクスとパフォーマンス : コンピュート レイテンシー パーセンタイル (P50/P95/P99)、経時的なエラー率とスループットの追跡、使用パターンとコストの分析、さまざまな期間またはフィルターにわたるパフォーマンスの比較。
  • 品質と評価 : 人間によるフィードバック、LLM 審査員、プログラムによるチェックからの評価スコアを確認します。評価データセットを検査し、登録済みのスコアラーとその構成を確認し、適切なスコアラーを使用してmlflow.genai.evaluate()設定するためのサポートを受けます。
  • ラベル付けとレビュー : ラベル付けセッションとトレースをレビューする担当者を表示し、ラベル付けスキーマを検査して、評価、コメント、期待などのフィードバック基準を理解します。
  • プロンプト レジストリ : Unity Catalog内のプロンプトを参照し、テンプレート、バージョン、エイリアスを表示します。
  • インストルメンテーション ガイダンス : Databricks ノートブックに直接貼り付けることができる実行可能なコード スニペットを使用して、 autolog()@mlflow.trace 、または手動スパンでコードにトレースを追加するためのヘルプを取得します。
注記

Genie Code は、MLflow エクスペリメントに記録されたデータ(トレース、スパンツリー、評価スコア、ラベリングセッション、登録済みプロンプト、スコアラーなど)を読み取ります。トレース分析およびデバッグ機能は、アプリケーションのソースコードではなく、この記録されたデータを読み取ります。「根本原因の特定」とは、それを引き起こしたソースコードの行ではなく、障害が発生したトレース内のスパン、入力パターン、または実行ステップを特定することを意味します。Unity Catalog に登録されていないプロンプト Template もスコープ外です。

例題

Genie Code に尋ねることができる質問は次のとおりです。

  • 「過去3時間のこの実験のトレースで、エージェントのツール呼び出しに関する問題を発見するのを手伝ってください」
  • 「エージェントとの会話でユーザーが不満を抱いているケースを特定する」
  • 「ユーザー フィードバック スコアが最も低いセッションはどれですか。また、それらの会話で何が問題だったのでしょうか。」
  • 「この 1 週間のトレースで最も一般的な失敗パターンは何ですか。また、それをキャッチするにはどのようなスコアラーを追加する必要がありますか。」
  • 「すべてのトレースにわたって、どのスパンが最も多くのトークンを消費しますか?」
  • 「リトリーバーが結果を返さなかったが、エージェントが回答しようとした痕跡を見つける」
  • 「適切なスコアラーを使って RAG エージェントの評価を設定できるように支援してください」

要件

エージェントの可観測性と評価に Genie Code を使用するには、ワークスペースに以下のものが必要です。

その他のリソース