AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

詳細なシステムプロンプトはコストを最大4.5倍増やすが精度向上なし——arXiv論文

公開:2026年10月2日, 最終更新:2026年10月2日

30秒サマリー

  • 職種特化の詳細システムプロンプトは、精度を平均0.6ポイント下げつつコストを最大4.5倍に膨らませると判明
  • ツール使用タスクでは詳細プロンプト使用時の正答率が10ポイント低下し、トークン・時間制限超過が頻発
  • 「あなたは役立つアシスタントです」程度の簡易プロンプトが、コストと精度の両面で同等以上の結果を示した

何が起きたか

Timothy Kassis氏(arXiv、2026年9月7日付)は、503種の職種特化システムプロンプトを収録したオープンソースコーパス「Scientific Agents」を用い、Gemini 3.8 Flash(OpenRouter経由)で大規模な比較評価を実施した結果を論文として公開した。

評価は9つのテキスト系科学ベンチマーク(合計4,531問からサンプリング)と、ツール使用を伴うバイオインフォマティクスベンチマーク「BioMysteryBench」(60問)を対象に行われた。比較条件は、①職種に対応した詳細プロファイル、②最小限のベースライン(「あなたは役立つアシスタントです」)、③プロファイル冒頭の役割文のみ、④汎用的な科学的厳密さガイド、⑤無関係ドメインのプロファイル、の5種類。

テキスト系ベンチマークの結果、詳細プロファイルとベースラインの平均精度差は−0.6ポイント(95%ブートストラップ信頼区間:−1.5〜+0.2)で、統計的に明確な精度向上はいずれのベンチマークでも確認されなかった。一方、コスト面では詳細プロファイルがベースラインの2.2〜4.5倍のコストを要し、出力トークン数も1.5〜2.3倍に増加した。

ツール使用タスクのBioMysteryBenchでは、詳細プロファイルの平均正答率46.7%に対し、ベースラインは56.7%と10ポイント高く(95%信頼区間:−16.7〜−3.3)、詳細プロンプトによるトークン・時間制限超過の頻発が主因とされた。ただし例外として、SuperGPQAでのプロバイダーAPIエラー頻発時には、長いプロンプトがエラー耐性に貢献した可能性も指摘されているが、これはドメイン専門知識よりもプロンプトの長さや書式の影響によるものと論文は分析している。

原典ハイライト

論文は「デフォルトでフルの職種プロファイルを読み込むことは、テスト済みのモデルとタスクにおいて精度を改善せず、コストを大幅に増加させる」と結論づけている。プロファイルの選択的な部分取得やオープンエンドな科学タスクへの適用が結果を変える可能性については、今後の検証課題として明示されている。

出典: arXiv cs.AI(論文)

So What?(なぜ重要か)

「詳細なシステムプロンプトほど賢く動く」という実務上の直感に、定量的な反証が示された。少なくとも本研究の条件(Gemini 3.8 Flash、科学系ベンチマーク)では、プロンプトの精緻化がそのままコスト増と精度低下につながっており、AIシステムの設計思想そのものを見直す契機となりうる。

日本企業への示唆

AIエージェントやチャットボットを業務導入・運用している日本企業にとって、詳細な職種定義や役割記述をシステムプロンプトに盛り込む設計が、コストを数倍に押し上げながら精度を改善しない可能性を示唆する。特にAPI従量課金で大量処理を行う場合、プロンプト設計の見直しが直接的なコスト削減につながりうる。まず「簡易ベースライン vs 詳細プロンプト」の社内A/Bテストを実施し、コストと精度のトレードオフを自社タスクで検証することを編集部は推奨する。なおツール使用型エージェント(コード実行・API呼び出しなど)では、長いプロンプトによるトークン・時間制限超過リスクにも別途注意が必要だ。

背景・経緯

システムプロンプトの設計はAIエージェント実装における重要な実務課題であり、「ペルソナ付与」や「役割定義」によって精度が向上するとの期待から、詳細なプロファイルを採用するケースが多い。本研究はその前提を科学的ベンチマークで検証したもので、オープンソースコーパス「Scientific Agents」(503プロファイル)を評価対象として用いている。評価・採点コードおよびアイテムレベルの記録は非公開とされている。