AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

LLMポストトレーニングを刷新する推定手法「LOO-ROLL」、GSM8Kで精度25ポイント改善

公開:2026年9月13日, 最終更新:2026年9月13日

30秒サマリー

  • 進化戦略ベースのLLM学習手法EGGROLLを理論的に解析し、新推定量LOO-ROLLを提案した論文がarXivに投稿された
  • LOO-ROLLは同一計算コストでEGGROLLの推定誤差(MSE)を半減し、8Bモデルまでの10通りのポストトレーニング設定中7件で性能改善
  • 数学推論ベンチマークGSM8Kでは0.6Bモデルで38.1%→63.0%、8Bモデルで65.9%→80.0%へ精度が向上

何が起きたか

Ege C. KayaとAbolfazl Hashemiの両研究者が2026年9月10日、arXiv(cs.LG)に論文「EGGROLL, Unrolled」を投稿した。同論文はLLMのポストトレーニングに進化戦略(ES)を活用する手法EGGROLLの理論的解析と改良を主題としている。

EGGROLLは密なガウス重み摂動を低ランク(多くはランク1)のガウス積に置き換えることで、LLMへの進化戦略適用を現実的な計算コストで実現する手法として知られる。論文は、ランク1摂動が幾何学的に制約された部分空間に限定される問題を理論的に特徴づけ、有限ランク・有限摂動半径における平均更新場と推定誤差を分析した。また、EGGROLLは任意のランク・半径においてすべての二次目的関数上で厳密解を与えることも示している。

改良手法として提案されたLOO-ROLL(leave-one-out推定量)は、EGGROLLが各探索方向につき2回の関数評価(対蹠評価)を必要とするのに対し、1回で済む設計となっており、同一評価コストのもとでトランスフォーマーブロックの推定MSEを半減させるとしている。最大8Bパラメータのモデルを用いた10のポストトレーニング設定での比較実験では、7件で個別ペアテストにて有意な改善を示し、有意な悪化はなかった。GSM8K数学推論テストでは、0.6Bモデルの精度が38.1%から63.0%へ、8Bモデルが65.9%から80.0%へそれぞれ向上した。一方、ランク比較実験ではランク8がランク1に対して再現性ある優位性を示さなかったと報告されている。

原典ハイライト

LOO-ROLLは「同一評価コストでMSEを半減」「8Bモデル・10設定中7件で改善」「GSM8Kで最大25ポイント近い精度向上」という定量結果を示しており、ランク1摂動の理論的限界を指摘しつつも実用上の優位性を論証した点が核心となっている。

出典: arXiv cs.LG(論文)

So What?(なぜ重要か)

LLMのポストトレーニング(RLHF・SFTなど)は膨大な計算資源を要するボトルネックだが、LOO-ROLLは推定効率の改善によりコストを据え置いたまま精度を大幅に引き上げる可能性を示している。特にグラジェント計算不要の進化戦略ベースの手法は、バックプロパゲーションが困難なAPIのみのモデルや分散学習環境でも適用しやすく、実務上の応用範囲が広い。ただし本論文はarXivの査読前論文であり、再現性の独立検証はこれからとなる。

日本企業への示唆

LLMの追加学習・ファインチューニングに取り組む日本企業にとって、EGGROLLおよびLOO-ROLLのような低ランク進化戦略は、GPU資源が限られた環境でもポストトレーニングを実施できる選択肢となりうる。特に数学・推論系タスクでGSM8Kスコアが大幅に改善された点は、製造・金融・法務などの業務特化モデル開発に示唆が大きい。査読前論文である点を踏まえ、自社の学習パイプラインへの適用前に実験環境での再現検証を行うことが望ましい。また、ランク8がランク1に対して優位性を示さなかったという知見は、計算コスト設計の見直し材料にもなる。

背景・経緯

進化戦略をLLMに適用するEGGROLLは、バックプロパゲーションを用いずにモデルを最適化できる手法として注目されてきた。計算上の魅力は大きいが、低ランク摂動に起因する理論的問題が十分に解析されていなかった。本論文はその理論的空白を埋めつつ、実用性を高める改良推定量を提案したものと位置づけられる。論文は全47ページ・6図で、最適化制御(math.OC)も対象分野に含まれている。