30秒サマリー
- 長期タスクをこなす広告AIエージェントに対し、SFTとRLの「使い分け」が性能向上の鍵と判明
- ターゲット型RLにより情報漏洩率を大幅削減しつつ、7スキル平均改善幅を+1.62→+3.57に向上
- RLの計算コストを43%削減しながら効果を高める診断フレームワークを提示
何が起きたか
Amazon関連と推定される研究チーム(Aakash Kolekarら9名)は、長期的なツール操作が必要な企業向け広告AIエージェントの学習において、教師ありファインチューニング(SFT)と強化学習(RL)をどう組み合わせるかを研究した成果を、2026年8月29日にarXivへ投稿した。本論文はEMNLP 2026 Industry Trackに採択されている。
研究では、学習の軌跡を「Imitation(SFTのみが有効)」「Lift(SFTとRL双方が有効)」「Discovery(RLが探索で上乗せ)」の3つのフェーズに分類する診断フレームワークを構築。この枠組みを使い、各機能をSFT単独・SFT後にRL・RL配分増・環境整備のいずれかにルーティングする「ターゲット型RL」を設計した。18件の後続実験では、診断が15/18の軌跡を正確に予測したと報告している。
GPT-OSS 120Bモデルを用いた評価では、ターゲット型SFT+RLが8つの広告主スキルのうち7つでフロンティアモデル(コントロール)に対してプラスの改善推定値を示した。うち5スキルは95%信頼区間がゼロを除外する有意な改善を確認。最大の改善は「非開示(non-disclosure)」スキルで+11.27ポイント(95% CI: +9.72〜+12.82)だった。また、専門家監査によれば、ターゲット型RLはSFT比で通常の情報漏洩を11.8%から2.9%へ、敵対的漏洩を22.9%から6.8%へ削減しつつ、実用性(actionability)は86.2%から85.7%とほぼ維持した。さらに、一様RL適用とのマッチド比較では、ターゲット型RLは7スキル平均改善幅を+1.62から+3.57に高め、かつ追加RLの計算コストを43%削減したと報告している。
原典ハイライト
診断フレームワークで各機能をSFT/RLに振り分ける「ターゲット型RL」を採用すると、一様なRL適用と比べ7スキル平均改善幅が2倍超になり、RLの計算コストを43%削減。情報漏洩率も大幅に低下した。
出典: arXiv cs.LG(論文)
So What?(なぜ重要か)
LLMエージェントの訓練において、RLをやみくもに全体に適用するのではなく、SFTで安定化できる領域とRLで探索が必要な領域を事前に診断して使い分けることで、性能と計算コストの両立が可能になることを示した。企業の実運用(プロダクション環境)を模したAPIで検証されており、実用性が高い知見といえる。
日本企業への示唆
社内でLLMエージェントをマーケティング・広告運用に活用しようとしている企業にとって、学習戦略の設計が性能とコストを大きく左右するという実証的根拠が得られた。SFTとRLの配分を「一律」に決めず、機能ごとに診断して使い分けるアプローチは、限られたGPUリソースで最大効果を狙う日本企業にも参考になる。また、情報漏洩率の低減(22.9%→6.8%)という結果は、顧客データを扱う広告・CRMシステムへのAI導入時のリスク管理においても検討に値する。ベンダー選定や内製開発の際、RLの適用方針を開示・確認するポイントとして活用できる。
背景・経緯
企業向けAIエージェントは、データ検索・推論・API呼び出し・コード実行など複数のステップをまたぐ「長期タスク」を担う場面が増えている。SFTは教師データに沿った安定した振る舞いを習得させるのに有効だが、RL適用で既習スキルが崩れるリスクもある。本研究はその課題に対し、プロダクション環境に近い条件での実験を通じて解決策を提示したもの。著者の所属は原文に明記されていない。



