公開:2026年10月3日, 最終更新:2026年10月3日
30秒サマリー
- AWSがSageMaker AIのマルチターンRL(MTRL)で検索エージェントをファインチューニングする手法を公式ブログで解説
- Qwen3.6-27Bモデルを使用し、4つのテストベンチマークのうち3つでnDCG@10が改善、最大+23.7%の精度向上を確認
- BrowseComp-Plusでの失敗率は22.89%から0.68%に激減し、信頼性改善が特に顕著
何が起きたか
AWSは公式ブログ(AWS Machine Learning Blog)にて、Amazon SageMaker AIのマルチターンRL(MTRL)機能を用いて検索エージェントをファインチューニングする実装手法と検証結果を公開した。
対象モデルはQwen3.6-27Bで、ファインチューニングには複数の公開データセット(FRAMES、BRIGHT、Enterprise RAG、MuSiQue、MLQAなど)を活用。評価指標には情報検索分野の標準指標であるnDCG@10を採用し、これをそのままMTRLの報酬関数として使用している。エージェントはBM25(キーワード検索)とベクトル検索の2ツールを持ち、複数ターンにわたって自律的に検索戦略を選択する。
評価結果として、4つのホールドアウトテストベンチマークのうち3つでnDCG@10が向上した。最大の改善はBrowseComp-Plus(+23.7%)とWixQA(+18.4%)で、Wandsでも小幅の改善を確認。一方、FreshStackでは若干の後退(リグレッション)が見られた。信頼性の面では、BrowseComp-Plusにおける失敗率(ターン制限またはトークン予算超過)が22.89%から0.68%へと大幅に低下した点が特筆される。
トレーニングのセットアップは最小限で、MultiTurnRLTrainerのSDKを使い、変更が必要なハイパーパラメータはmax_epochs・global_batch_size・rollout_max_concurrencyの3つのみ。アルゴリズムの選択や優位推定量の設定はデフォルト値で動作するよう設計されており、MLエンジニアリングの専門知識がなくても構成できると説明されている。
原典ハイライト
BrowseComp-Plusでの失敗率が22.89%から0.68%へ激減し、精度(nDCG@10)も+23.7%向上。設定変更は3つのハイパーパラメータのみで、RL専門知識なしに構成可能と原文は説明している。また、サーバーレス実行でGPUクラスターの管理が不要となるトークン単位の従量課金モデルを採用している点も強調されている。
出典: AWS Machine Learning Blog(公式ブログ)
So What?(なぜ重要か)
フロンティアモデル(大規模・高コストなLLM)に頼らずとも、小規模モデルをMTRLでファインチューニングすることで、高い検索精度と信頼性を両立できる可能性を示した実験結果といえる。特に失敗率の劇的な低下は、企業の社内検索システムや問い合わせ対応への実運用適用における「信頼性」という課題に対して、具体的な解決策の一つを提示している。コスト面でも、推論時に小規模モデルを使える点でメリットがある。
日本企業への示唆
社内ナレッジベース検索、カスタマーサポート対応、製品検索など、マルチターンの自律的な情報探索が必要な業務でこのアプローチは参考になる。GPT-4クラスの大型APIに依存しているシステムを見直し、自社データでファインチューニングした小規模モデルへの置き換えを検討する際の技術的根拠の一つになり得る。ただし、本ブログはAWSが自社サービスの活用事例として公開したものであり、汎用的な検証結果とは切り分けて評価することが望ましい。実運用への適用前には、自社のデータセットと評価指標での独自検証を行うべきだ。
背景・経緯
LLMを活用した検索エージェントは、従来のキーワード検索と異なり、複数ラウンドの試行を通じて検索戦略を自律的に調整する。こうしたマルチターン挙動を小規模モデルで実現するには、専門家による軌跡データ収集が必要なSFT(教師あり微調整)や、1ターン単位でしか最適化できない単一ターンRLでは限界があるとされてきた。MTRLはこの課題に対応するアプローチとして、Amazon SageMaker AIの機能として提供されている。原文では、同機能がPPOやCISPOなどの複数のアルゴリズムと、GPROなどのグループベース優位推定量をサポートすることも紹介されている。





