AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

問題難易度に応じてAIの思考量を動的制御、トークン消費27.9%削減の新手法

公開:2026年9月19日, 最終更新:2026年9月19日

30秒サマリー

  • LLMが「簡単な問題を考えすぎ、難問を考え足りない」という非効率を解消する研究論文がarXivに登場
  • 提案手法「When2Think」は問題の難易度を自動判定し、計算資源を動的に配分するポストトレーニング・フレームワーク
  • 数学ベンチマークAIME24でトークン使用量27.9%削減と同時にPass@3を10.0%向上と報告

何が起きたか

2026年9月17日、Jaejun Shimら4名の研究者がarXiv(cs.AI)に論文「When2Think: Learning Difficulty-Aware Length Control for Efficient Hybrid Reasoning Models」を投稿した。

論文が指摘する課題は、大規模推論モデル(LRM)が持つ「系統的な非効率性」だ。簡単な問題に対して過剰な推論(Overthinking)を行い、逆に難しい問題では推論が不十分になる(Underthinking)という傾向がある。既存の対応策として均一な長さペナルティや固定ルーティングが試みられているが、これらは計算削減と精度低下のトレードオフを生じさせると研究者らは述べている。

これに対してWhen2Thinkは、「インスタンス適応型計算配分」として問題を定式化し、問題ごとに計算量を動的に割り当てるポストトレーニング・フレームワークを提案する。核心となるのは「Instance-level Difficulty-Aware Control(IDAC)」と呼ぶ報酬成形メカニズムで、事前に計算された参照統計(正答率とトークン使用量)を活用して推論の深さを制御する。学習済み報酬モデルやオンラインの参照モデル参照を必要とせず、安定した最適化が可能だとしている。

数学ベンチマークでの実験結果として、AIME24ではベースモデル比でPass@3が10.0%向上、トークン使用量が27.9%削減されたと報告している。またAIME25ではPass@3が40.0%となり、圧縮・ルーティング単体のベースラインを上回ったとしている。

原典ハイライト

「簡単な問題には直接回答(System 1:NoThink)、難しい問題には拡張推論(System 2:Think)を使い分けることを学習させる」という設計思想が論文の核心。IDACが事前統計を報酬信号として活用することで、追加の報酬モデル学習なしに安定した訓練を実現している点が技術的特徴として挙げられている。

出典: arXiv cs.AI(論文)

So What?(なぜ重要か)

LLMの推論コストは処理するトークン数に直結するため、「考えすぎ」の排除は実運用コストの直接削減につながる。本研究が示すのは、精度を犠牲にせずトークン消費を約3割削減できる可能性であり、APIコスト最適化やオンプレAI基盤の処理効率向上において実用的な意義を持つ。ただし現時点でarXiv投稿段階の研究であり、査読や外部での再現検証はこれからとみられる。

日本企業への示唆

AIを業務システムに組み込む日本企業にとって、推論コストの削減は投資対効果に直結する経営課題だ。When2Thinkのような「難易度適応型」アプローチが実用化されれば、ルーティング設計やプロンプト最適化に頼らずともコスト効率が改善できる可能性がある。自社LLM開発や基盤モデルのファインチューニングを検討している企業は、ポストトレーニング段階での効率化手法として本研究の動向を追うことが望ましい。また、既存の「均一長さ制限」による精度低下に悩む導入済みユーザーにとっても、代替手法の選択肢として注目に値する。

背景・経緯

LRMの推論効率化は活発な研究領域であり、長い思考連鎖(Chain-of-Thought)が精度向上に寄与する一方でコスト増大を招くという問題意識が背景にある。論文では既存手法として「均一な長さペナルティ」と「固定ルーティング」が言及されており、When2Thinkはそれらの限界を克服する位置づけとして提案されている。