公開:2026年10月8日, 最終更新:2026年10月8日
30秒サマリー
- arXivに投稿された論文が、LLMの推論能力を少数の注意ヘッドに局在化して制御する推論時ステアリング手法「COMPASS」を提案
- 数学ベンチマークGSM8Kで平均16ポイントの精度向上、かつCoT比で20〜70%少ないトークン生成でほぼ同等の精度を達成
- 追加学習不要で未知のベンチマークにも転用可能であり、推論コスト削減と精度向上の同時実現が実用上の最大の特徴
何が起きたか
Pratyay Duttaら3名の研究者が2026年10月5日にarXivへ投稿した論文(v2は10月7日)で、大規模言語モデル(LLM)の推論能力がモデル内のどこに「宿っているか」を特定し、推論時に介入する手法「COMPASS」を提案した。
COMPASSの核心は、モデル自身の直接回答の正誤という単純なシグナルから「正確さの方向」と呼ばれる潜在ベクトルを抽出し、推論時にその方向へ注意ヘッドの活性化を操作するという仕組みにある。論文によれば、この正確さの方向はほとんどの注意ヘッドの活性化内でデコード可能だが、実際に効果的に介入できるのはごく少数のヘッドに限られるという。COMPASSはロジット空間の帰属スコアを用いてその対象ヘッドを特定し、各ヘッドの活性化統計のみを必要とするため、大規模な再学習は不要だとしている。
3つのモデルファミリーと複数の数学ベンチマークで評価した結果、既存のアクティベーションステアリング手法を上回り、GSM8Kにおいて平均16パーセントポイントの精度向上を達成。さらに、Chain-of-Thought(CoT)プロンプティングと同程度の精度に迫りながら、生成トークン数を20〜70%削減できたと報告している。介入効果は未知のベンチマークにも再フィッティングなしで転移するとされる。
原典ハイライト
「モデル自身の直接回答の正誤という単純なシグナルだけで、CoTプロンプト設計や対照的CoT方向、SAE由来の特徴量といった事前定義が不要な潜在方向を得られる。この方向を担う注意ヘッドはごく少数に集中しており、そこへの介入だけで推論能力を引き出せる」(論文アブストラクトより要約)
出典: arXiv cs.AI(論文)
So What?(なぜ重要か)
LLMに長い思考連鎖(CoT)を生成させることなく、モデル内部の特定ヘッドを操作するだけで推論精度を大幅に高められるとすれば、推論コストの構造が変わりうる。現状、高精度な推論にはトークン数が多く推論コストがかさむという課題があるが、COMPASSのような手法が実用化されれば、コストと精度のトレードオフを根本的に改善できる可能性がある。ただし本論文はarXivへの投稿段階であり、査読済み研究ではない点に留意が必要だ。
日本企業への示唆
数学的推論や論理タスクにLLMを活用している日本企業にとって、推論トークン数の削減はAPIコスト直結の課題である。COMPASSの手法が実装可能な形で公開・実用化された場合、既存モデルに手を加えずに推論品質を高めながらコストを抑えられる選択肢となりうる。自社でLLMをホスティング・ファインチューニングしている企業は、こうした推論時介入(inference-time steering)の研究動向を注視し、APIコスト試算や精度目標の見直しに備えることを検討したい。
背景・経緯
LLMの推論能力向上にはCoTプロンプティングが広く使われてきたが、長い思考連鎖はトークン消費量が多くコスト増につながる。アクティベーションステアリングと呼ばれるモデル内部の活性化を操作するアプローチも研究されてきたが、従来手法はCoTのプロンプト設計や対照的な方向の定義など事前の設計が必要だった。COMPASSはこれらの制約を緩和することを目指した手法として位置づけられる。



