AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

AIエージェントの誤動作を外部審査で抑制する新アーキテクチャ「DeReAct」をarXivで提案

公開:2026年10月5日, 最終更新:2026年10月5日

30秒サマリー

  • ReActベースのAIエージェントが抱える「単一LLMへの過度な依存」問題に対し、行動検証と完了判定を分離するモジュラー設計を提案
  • ベンチマーク(GAIA・SWE-bench Verified)で能力の低いモデルほど効果が大きく、Pass@1が最大7ポイント向上
  • 強力なモデルでも「根拠のある完了判定」の質が向上し、精度と信頼性の両立を示唆

何が起きたか

Ajay VohraらはarXivに論文「DeReAct: Decomposed Reasoning and Acting for Reliable AI Agents」を2026年10月1日に投稿した。論文はReActベースのAIエージェントが抱える構造的な問題を指摘し、その解決策として「DeReAct」と呼ぶモジュラーアーキテクチャを提案している。

従来のReActエージェントは、行動の提案・環境との対話・タスク完了の判断をすべて単一のLLMポリシーが担う。このため、行動認可と完了判定を独立して制御しにくく、エラーが伝播したり、根拠のない完了宣言によって処理が途中終了するリスクがあると論文は指摘する。

DeReActはこの問題に対し、「Critic(批評器)」と「Context Manager(文脈管理器)」という2つのゲーティングポリシーを外部化する設計を採用する。Criticは行動実行前に提案内容を検証し、Context Managerは環境の情報をもとに状態を再構築してタスク完了を認証する役割を担う。

評価はGAIAとSWE-bench Verifiedの2つのベンチマークで実施された。能力の低いモデル(Qwen3-Coder-480B、Claude Sonnet 4.5)ではPass@1が6.5〜7.0ポイント、4.2〜5.2ポイントそれぞれ向上した。一方、より高性能なClaude Opus 4.5ではPass@1の数値はReActと同水準に留まったが、DeReActのほうが根拠が充実し制約を満たす行動軌跡が得られたと論文は述べている。

原典ハイライト

論文は「外部ゲーティングは、対象とする失敗が十分に多く、ゲーティングポリシー自体が適切な場合に有効である」と結論付けており、アーキテクチャの適用条件を明示的に示している点が特徴的。また、強いモデルでは精度向上よりも「完了判定の根拠品質向上」という別の効果があることも指摘している。

出典: arXiv cs.AI(論文)

So What?(なぜ重要か)

AIエージェントの信頼性問題は、モデルの能力向上だけでは解決できないことをこの研究は示唆している。行動の承認と完了判断を外部モジュールに分離するという設計思想は、エンタープライズ環境でのエージェント運用に直結する。特に、コストの低い(能力の弱い)モデルを業務に使う場合でも、アーキテクチャ工夫により精度を補えることは実用上の意味が大きい。

日本企業への示唆

社内業務にAIエージェントを導入・検討している日本企業にとって、このアーキテクチャは二つの観点で参考になる。第一に、高価な最高性能モデルを使わなくても、設計次第でエージェントの信頼性を高められるという点は、コスト最適化の選択肢を広げる。第二に、エージェントの「行動実行前チェック」と「完了判定の根拠確保」を設計要件として明示するという考え方は、社内承認フローや監査への対応を見据えたシステム設計に活かせる。論文はまだプレプリント段階であり、実用化には実環境での検証が必要だが、エージェント基盤の設計指針として参照する価値がある。

背景・経緯

ReActは推論(Reasoning)と行動(Acting)を組み合わせてLLMエージェントを動かす手法として広く採用されている。一方でエージェントが自律的に行動・完了判定を行う単一ポリシー構造は、誤りの連鎖や根拠なき早期終了という課題を抱えており、エンタープライズ用途での信頼性確保が業界共通の課題となっている。DeReActはこの文脈での構造的解決策として提案された。