公開:2026年8月29日, 最終更新:2026年9月1日
トークン効率スコア(TES)(Token Efficiency Score / Token Economy Score)は、LLM(大規模言語モデル)やAIエージェントの運用において、消費したトークン数に対するパフォーマンスや出力品質の効率性を定量化する指標の総称である。現在、複数の組織・研究者が「Token Efficiency Score」または「Token Economy Score」という異なる名称で、それぞれ独自の定義と計算式を提唱しており、業界標準として統一された定義はまだ存在しない。
概要
TESは、AIシステムがトークンを消費するコストに対して、どれだけ有益な結果を生み出せているかを測る指標群の略称として用いられている。LLMの利用コストはトークン消費量に直結するため、「正確さ」だけでなく「正確さあたりのコスト」を評価する必要性が高まる中で注目を集めている。
現在確認されている主な定義は以下の4種類である。
- Token Economy Score(Lenovo研究チームによる定義):2026年8月にLenovoの研究チームが発表した論文『The Reasoning Tax』で提唱された指標。推論モデルが非推論モデルに対して得る正確性の向上を、生成トークンの倍率で割ったもの。計算式は `TES = (推論モデルの正確性 – 非推論モデルの正確性) / 生成トークン倍率`。
- Token Efficiency Score(Unmeshed定義):AIシステムが消費した総トークン数のうち、実際に有用だった出力トークン数の割合。計算式は `Efficiency Score = 有用な出力トークン数 ÷ 総消費トークン数`。
- Token Efficiency Score(エージェント比較定義):タスク完了スコアと消費トークン数を組み合わせた指標。計算式は `TES = (Score × 100) / (Tokens / 1000)`。
- Token Efficiency Score(金融LLM定義):2025年12月に発表された論文『Is GPT-OSS All You Need?』で提唱された、正確性と処理速度(Tokens per Second)を掛け合わせ、モデルのパラメータ数(10億単位の対数)で割った指標。計算式は `TES = (Accuracy × Tokens per Second) / log(Model Parameters in Billions)`。
仕組み・ポイント
各定義は文脈や用途によって異なるが、共通する考え方は「トークンのコスト(消費量)に対して、どれだけの価値ある出力が得られたか」を数値化する点にある。
Lenovo研究チームが提唱するToken Economy Scoreでは、TESが1より大きければ推論に経済的合理性があると判断し、0未満であれば推論を行うことでかえって精度が下がると解釈する。また、数学やコード生成のように順序的な推論チェーンが必要なタスクではTESが高くなりやすい一方、知識の想起タスクでは難易度が高くてもTESが低くなる傾向があるとされている。さらに、推論の強度を高めすぎると収穫逓減が発生し、追加の思考が正確性を低下させるケースも報告されている。
Unmeshed定義では、スコアが0.8以上であることが望ましいとされており、製品に組み込むAIシステムの品質管理指標として活用されている。エージェント比較定義では、CLIベースのエージェントがMCP(Model Context Protocol)ベースのエージェントと比較して33%効率的(202.1対152.3)という具体的な比較結果も示されている。
なぜ今注目されているのか
推論モデル(Reasoning model)の普及により、LLMが問題解決のために大量のトークンを内部で消費するケースが増加している。これに伴い、「高精度であること」と「コストが見合うこと」は必ずしも一致しないという問題が顕在化しており、推論モデルのコスト対効果を定量化する必要性が高まっている。AIエージェントが複雑なタスクを自律的に処理する場面が増えるにつれ、単なる精度評価では不十分となり、トークン消費効率を加味した評価軸が求められるようになった背景がある。
日本企業への示唆
LLMの利用コストはトークン消費量に直接連動するため、特に大量のAPI呼び出しを行うエンタープライズ用途では、TESのような効率指標の導入が運用コスト管理の実践的な手段となりえる。ただし、現時点では提唱元によって定義・計算式が異なるため、社内でTESを採用する際はどの定義を用いるかを明確に定めた上で運用する必要がある。また、タスクの種類によってTESの意味が変わることから、単一のスコアで全用途を評価しようとするのではなく、業務領域ごとに適切な指標を選択する視点が重要である。
※ 本ページはAI News JAPAN編集部が最新の動向を踏まえて解説したものです。内容は随時見直します。


