公開:2026年9月12日, 最終更新:2026年9月12日
エージェント評価メトリクス(AEM: Agent Evaluation Metric)は、マルチターンのAIエージェント会話においてターン単位でエラーの根本原因を特定・測定するための評価指標です。2026年9月にAWSがAWS Machine Learning Blogで提唱しました。
概要
AEMは、複数回のやり取り(マルチターン)で構成されるAIエージェントの会話を評価する際に、タスク全体ではなく個々のターンを単位として品質を測定する分解可能な評価指標です。従来のタスクレベル評価(タスク完了率など)では、会話全体の成否しか判定できず、どのターンが失敗の根本原因かを特定することが困難でした。AEMはこの課題に対処するために設計されています。
仕組み・ポイント
カスケード障害への対処
マルチターン会話では、初期ターンで発生した1つの誤り(例:ツール呼び出し時のパラメータ誤り)が後続のすべてのターンに連鎖する「カスケード障害(Cascading Errors)」が起きやすい構造があります。AEMはターン単位で評価を分離することで、根本原因となったターンと、そこから影響を引き継いだターンを区別します。
評価次元とサブ指標
第一の評価次元として「正確性(Correctness)」を定義し、これを以下の2つのサブ指標に分解します。
- 真実性(Truthfulness):ツール呼び出しのパラメータ値や自然言語応答が、期待値と意味的に一致するかを判定する
- 完全性(Completeness):必要なパラメータや情報の欠落、または過剰な情報がないかを検出する
障害分類ラベル
「prior_action_failed」というラベルを導入し、あるターンの失敗が「そのターン自体に起因するエラー(根本原因)」なのか、「先行ターンから引き継いだカスケード影響(継承エラー)」なのかを明確に分類します。
スコアリングと拡張性
最終スコアは「合格ターン数の割合」として算出されます。また、安全性や命令保持など将来的な評価次元も同じ仕組みで追加できる拡張可能な設計となっています。
なぜ今注目されているのか
AIエージェントが業務プロセスの自動化に活用される場面が広がるにつれ、単発の問い合わせ応答ではなく、複数ステップにわたる複雑なタスク遂行の品質をどう担保するかが実務上の課題となっています。タスク完了率のような粗い指標では、どこに問題があるかを改善につなげにくいという限界があり、AIエージェントの評価・監査を体系化しようとする動きが研究・産業の両面で活発化している文脈の中で、AEMへの注目が高まっています。
日本企業への示唆
AIエージェントを業務システムに組み込む際、タスクレベルの成否だけで評価していると、改善のボトルネックが特定できずに品質向上が停滞するリスクがあります。AEMのようなターン単位の分解評価を導入することで、どのステップ・どのツール呼び出しに問題があるかを具体的に把握でき、開発・運用サイクルの効率化につながります。一方で、評価指標の設計自体にコストと専門知識が必要であるため、自社のユースケースに合わせた評価次元の定義をどこまで行うかを、導入初期から検討しておくことが重要です。
※ 本ページはAI News JAPAN編集部が最新の動向を踏まえて解説したものです。内容は随時見直します。


