公開:2026年9月12日, 最終更新:2026年9月12日
30秒サマリー
- AWSがAmazon Bedrock上のOpenAIモデルを「正答1件あたりのコスト」で比較するベンチマーク手法を公式ブログで解説
- エージェント型ワークロードではターン数増加でコストが二乗的に膨らむ構造を実測データで示した
- 2026年7月30日の値下げ後、luna(GPT-5.6-Luna)が複数ワークロードで最低コストを記録
何が起きたか
AWS Machine Learning Blogは、Amazon Bedrock上で提供されるOpenAIモデル(gpt-5.6-luna、gpt-5.6-terra、gpt-5.6-sol)と、OpenAI API上のコスト最適化モデル(gpt-5.4-mini、gpt-5.4-nano)を対象に、トークン単価ではなく「正答1件あたりのコスト」を軸にしたベンチマーク手法を解説した。評価対象は、競技数学(AIME)・大学院レベル科学(GPQA Diamond)・MMLU-Proでの単一呼び出し精度、ウェブリサーチ型エージェントのターン数と累積コスト(DeepSearchQA)、そして専門職が作成した成果物の採点(GDPval)の3領域。
単一呼び出しの精度比較では、AIMEの正答率はsolが75%、miniが37%と能力差が明確に現れた。2026年7月30日の価格改定(luna −80%、terra −20%)後、luna の正答1件あたりコストはAIMEで0.0021ドルに対し、miniは0.0139ドルと記録されている。ブログはこれを「名目トークン単価が低いnanoよりもlunaの方が正答あたりコストが低い」結果として紹介している。
エージェント型ワークロードでは、会話履歴を毎ターン全文再送する構造(store: false)のもと、ターン数が増えるほど入力トークン量が約二乗的に増加することを実測で示した。DeepSearchQA(50問)での結果では、miniの平均ターン数が7.6回と最多で、入力トークン量はterraの2.3倍(約114k対50k)に達した。lunaは正答1件あたり0.05ドルでminiの0.40ドルを大幅に下回った。専門職成果物の評価(GDPval・48タスク)では、価格改定後にlunaが最低コスト(合格成果物1件あたり0.010ドル)かつ最高合格率(56%)を記録した。
ブログは、これらの評価に用いたベンチマークハーネス(openai-on-aws/benchmarks-openai)をオープンソースで公開しており、同一コードパスで両プラットフォームを比較できると説明している。なおAmazon Bedrock上のモデルはreasoningを無効化した設定で評価されており、モデル固有の能力比較ではなく実用的なデプロイ構成の比較だと明記されている。
原典ハイライト
エージェントワークロードでは「ターン数の増加が入力トークン量を約二乗的に膨らませる」という構造的コスト要因を実測で示し、トークン単価だけでは捉えられない「正答あたりコスト」「ターンあたりコスト」を軸にしたモデル選定フレームワークを提示した点が核心。
出典: AWS Machine Learning Blog(公式ブログ)
So What?(なぜ重要か)
生成AIの導入コスト評価が、従来の「トークン単価×推定使用量」から「正答1件あたりコスト」「エージェントのターン効率」へと変わりつつあることを示す。特にエージェント型システムでは、ツール呼び出しのループが増えるほどコストが非線形に拡大する構造的リスクがあり、設計段階からターン数の制御を考慮する必要がある。また、2026年7月の大幅値下げにより、上位モデルへの移行が「品質向上のためのコスト増」ではなく「同等以下のコストでの品質向上」として成立しうることをデータが示している。
日本企業への示唆
日本企業がAmazon BedrockでOpenAIモデルを採用する際、まず自社ワークロードの「正答率」と「エージェントのターン数」を実測することが先決となる。カスタマーサポートや法務・コンプライアンス文書生成など、品質ゲートが明確な業務では、トークン単価の安さよりも「合格成果物1件あたりコスト」で評価軸を設定すべきだ。また多段階リサーチやデータ収集を行うエージェントを構築する場合、ターン数の上限設計とコンテキスト管理がコスト変数として重要であることをシステム設計段階で織り込む必要がある。価格体系は変動しうるため、AWSが公開しているオープンソースのベンチマークハーネスを活用し、本番移行前に自社タスクで再評価することをAWS自身も推奨している。
背景・経緯
Amazon BedrockはAWSが提供する複数の基盤モデルを統一APIで利用できるサービスで、OpenAIのモデルもBedrock経由で提供されている。原文によれば2026年7月30日にGPT-5.6 LunaおよびTerraのAmazon Bedrock上の価格が改定(luna −80%、terra −20%)されており、この価格改定が本ブログの分析の前提条件の一つとなっている。ベンチマーク結果はus-west-2(solはus-east-1)での2026年7月時点の測定値であり、レイテンシ等は時点・リージョン依存の点に注意が必要とブログ自身が明記している。






