公開:2026年9月20日, 最終更新:2026年9月20日
30秒サマリー
- LLMが推論中の誤りを自律的に修正できるよう、失敗した推論軌跡を訓練データに変換する自己教師あり手法を提案
- DeepSeek-R1-Distill-Qwen-7BでAIME 2025の正答率が30.0%→37.5%、Minervaが37.6%→47.8%に向上
- 外部の評価モデルや報酬モデルに頼らず、モデル自身が誤りを認識・修正する「創発的自己修正」能力を獲得
何が起きたか
香港大学などの研究者4名(Qirui Chen、Renjie Pi、Jiahui Gao、Lingpeng Kong)は2026年7月24日、大規模言語モデル(LLM)の推論精度を向上させる自己教師あり手法「Reflective Recovery」をarXivに投稿した。
従来の主流手法は、正しい推論過程のみを模倣学習(imitation learning)に用いる。しかし論文は、問題セットが限られている場合に正例を増やしても性能が頭打ちになる「Scaling Collapse(スケーリング崩壊)」という限界を指摘している。また推論中に誤りが生じると、LLMは誤った状態から回復できずに間違いが蓄積されやすい構造的な問題もある。
Reflective Recoveryはこの課題に対し、失敗した推論軌跡の前半部分を切り出してプロンプトに連結し、そこから正解へ至る経路を学習させる仕組みを採用する。外部の批評モデルや報酬モデルを必要とせず、失敗データをそのまま訓練資源として活用できる点が特徴だ。
評価実験では、DeepSeek-R1-Distill-Qwen-7Bに同手法を適用した結果、AIME 2025で正答率30.0%→37.5%、Minervaで37.6%→47.8%の改善を確認。また、スケーリング崩壊の壁を破り、モデルが推論中に自律的に誤りを訂正する創発的な振る舞いが生まれたと論文は述べている。
原典ハイライト
論文は、正例のみによる模倣学習が「Scaling Collapse」という性能限界を持つと指摘し、失敗した推論軌跡を訓練データに変換することで外部評価器なしに自己修正能力を獲得できることを示した。成果指標として、AIME 2025で+7.5ポイント、Minervaで+10.2ポイントの精度向上を報告している。
出典: arXiv cs.CL(論文)
So What?(なぜ重要か)
本研究が示す最大の意義は、AIが「失敗そのものから学ぶ」自己改善サイクルを、追加の外部インフラなしに実現できる可能性を示した点にある。これまでRLHFや報酬モデルといったコスト・専門知識を要するインフラが必要とされてきた自己修正機能が、自己教師あり方式で代替できるとすれば、LLMのファインチューニングコストと難易度が大幅に下がる可能性がある。ただし本論文はarXiv段階の査読前研究であり、実用上の効果については今後の検証が必要である。
日本企業への示唆
日本企業がLLMを業務推論(法務審査・財務分析・設計レビューなど)に活用する場合、推論途中の誤りが致命的なアウトプット品質低下につながるリスクは常に存在する。Reflective Recoveryのような手法が実用化されれば、自社データの失敗ケースをそのままモデル改善に活かせる可能性があり、外部APIや高コストな報酬モデルへの依存を減らしながら精度を高めるルートとして注目に値する。AI導入を検討する企業は、「正解データの収集」と同等以上に「失敗事例の蓄積と構造化」を内部プロセスに組み込む設計を今から検討することが望ましい。
背景・経緯
LLMの推論強化には、人間のフィードバックを用いる強化学習(RLHF)や、正しい推論ステップを模倣させるデータ駆動型ファインチューニングが広く使われてきた。しかし正例データの量に依存する手法はデータ拡充の効果が逓減する問題を抱えており、誤りからの回復能力をいかに獲得させるかが研究上の課題となっていた。本論文はその課題に対し、失敗軌跡を積極的に活用する自己教師あり枠組みで対応しようとするものである。



