AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

AWSがエージェントのシステムプロンプト最適化の仕組みをブログで詳解

公開:2026年9月17日, 最終更新:2026年9月17日

30秒サマリー

  • Amazon Bedrock AgentCoreのシステムプロンプト最適化機能の内部設計をAWSが公式ブログで解説
  • 2種類のリフレクター設計を比較評価し、Sub-Agent Reflectorが公開ベンチマークで最高精度を記録
  • 最適化の暴走を防ぐガードレール(長さ制限・安全審査・トレースフレーズ禁止)も実装済み

何が起きたか

AWSは公式機械学習ブログで、Amazon Bedrock AgentCoreに搭載されているシステムプロンプト最適化機能の技術的な設計と評価結果を詳述した。同機能は以前のローンチ投稿で紹介済みのものであり、今回の記事はその技術的な補足として位置づけられている。

最適化の中核となるのは「リフレクター」と呼ばれる推論コンポーネントで、AgentCore Observabilityに記録されたエージェントのトレースを評価スコアとともに分析し、システムプロンプトの改善案を自動生成する。トレースはモデルのコンテキストウィンドウを超えるケースが多いため、ファイルシステム経由でリフレクターエージェントに提供し、シェルツール(grep・cat・diffなど)で必要な箇所を選択的に参照する設計を採用している。

リフレクターには2種類ある。「Single Agent Reflector」は1つのエージェントがトレース全体を一度に精査し、AppWorldベンチマークで81.55%(6分・20ターン)、WebShopで78.31%(1分・5ターン)を達成。GEPAやMIPROv2と比べて最大36倍高速とされる。一方、実験的なオープンソース版「Sub-Agent Reflector」は、複数のサブエージェントがトレースを個別に分析して知見を集約する構造をとり、AppWorldで95.83%、WebShopで79.15%と両ベンチマークで最高スコアを記録した。

最適化の品質を担保するため、設定変更の候補には3つのガードレールが適用される。前バージョンから20%超の長文化を拒否する「長さ上限」、安全基準への適合チェック、および最適化対象トレースからの語句をそのまま流用することを禁じる「バーベイタム禁止」ルールだ。同ブログは、推奨設定として10〜50件程度の多様なトレースから始めること、スカラー報酬に加えて評価者の根拠文や人間のアノテーションを含めること、および推奨結果はオフライン評価とA/Bテストで検証してから本番適用することを挙げている。

原典ハイライト

Sub-Agent Reflectorはトレースをサブエージェントが独立に3段階(表層・ターン・認知)で分析してオーケストレーターが統合する設計で、AppWorldにおいてベースライン比23ポイント改善の95.83%を達成。Single Agent Reflectorはベースライン超えを維持しつつGEPA比18倍・MIPROv2比36倍の高速化を実現した。

出典: AWS Machine Learning Blog(公式ブログ)

So What?(なぜ重要か)

AIエージェントのシステムプロンプト改善はこれまで人手によるトレースレビューと試行錯誤に依存していたが、同機能はその工程を自動化するアプローチを示す。特にSingle Agent Reflectorの「6分で競合水準に到達」という結果は、開発・評価のイテレーション速度を大幅に短縮できる可能性を示唆している。また、最適化そのものにガードレールを組み込む設計は、プロンプトが安全制約を緩める方向に漂流するリスクへの対処策として注目に値する。

日本企業への示唆

生成AIエージェントを業務に導入・運用している日本企業にとって、プロンプトチューニングの属人化と工数が課題になりやすい。本機能のように本番トレースをフィードバックとして活用する自動最適化の仕組みは、品質管理プロセスの標準化につながりうる。ただし、推奨結果の採用にはオフライン評価とA/Bテストによる検証が前提とされており、機能を利用する側でも評価基盤の整備が必要になる点は留意が必要。Sub-Agent Reflectorはオープンソースとして公開されているため、AWSサービスに限らず自社エージェント基盤への応用可能性も検討に値する。

背景・経緯

Amazon Bedrock AgentCoreはエージェントの観測・評価・最適化を統合的に提供するAWSの機能群。今回のブログは、以前公開されたAgentCore optimizationのローンチ投稿に続く技術的な深掘り記事として位置づけられており、システムプロンプト最適化の仕組みが初めて詳細に公開された形となる。評価に用いたリフレクターモデルはOpus 4.6、タスクモデルはSonnet 4.5と原文に明記されている。