AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

ERPシステム向けAIエージェント評価基準「ERPBench」、基幹系での信頼性欠如を実証

公開:2026年9月17日, 最終更新:2026年9月17日

30秒サマリー

  • 一般的なGUI操作が得意なAIエージェントでも、ERPシステム上では正確なデータ保存に著しく失敗することが判明
  • 保存操作の成功率が最大85%でも、正しい値の書き込みは3%にとどまるケースも確認
  • 研究チームは稼働中の実ERPシステムを使ったベンチマーク「ERPBench」を開発し、6種類のエージェントを評価

何が起きたか

2026年9月15日、Kratika Bhagtaniら5名の研究者がarXivに論文「ERPBench」を公開した。同論文は、スクリーンショットのみを入力として操作するコンピューター使用エージェント(computer-use agent)を、実際に稼働中の再現可能なERPシステム上で評価するためのベンチマークを提案するものだ。

論文の核心的な発見は、汎用GUIタスクで高い性能を示すAIエージェントが、ERP環境では信頼性を維持できないという点にある。具体的には、あるエージェントが実行の85%でフォームの保存操作に「成功」する一方で、データベースに正しい値を書き込めたのはわずか3%にとどまったという結果が示されている。これはERPシステムの画面上ではエラーが表示されないまま、内部の業務データが誤って更新されるリスクがあることを意味する。

ERPBenchの評価手法の特徴は、エージェントの操作結果をデータベース内のグラウンドトゥルース値と照合してスコアリングする点にある。既存の企業向けベンチマークが独自プラットフォームや模擬環境に依存していたのに対し、ERPBenchは実システムを使用する。また論文では、エージェントの操作を人間の承認でゲートする「本番グレードのハーネス」も提案されており、ERPBenchはこれを用いた自律的な評価も実施している。6種類のクローズドおよびオープンソースのエージェントが評価対象となったが、具体的な製品名は原文では言及がない。

原典ハイライト

「エージェントが正しいフォームにたどり着いて保存操作まで完了しても、保存されたレコードが誤っていることが多い。一部のエージェントは85%の実行で保存するが、正しい値を書き込めるのはわずか3%だ」——論文アブストラクトより要約

出典: arXiv cs.AI(論文)

So What?(なぜ重要か)

AI研究コミュニティにおいて、「画面上の操作の成否」と「業務データの正確性」は別物であることが定量的に示された。ERP導入企業がAIエージェントを評価する際、UIレベルの成功率だけでは信頼性を判断できないことが明確になった。基幹系システムへのAI自動化導入における評価基準の再定義を促す研究成果といえる。

日本企業への示唆

SAP・Oracle・Microsoft DynamicsなどのERPを運用する日本企業がAIエージェントによる業務自動化を検討する際、「操作の完了」ではなく「データの正確性」を検証する評価プロセスが不可欠だ。ERPBenchが示した「DB値との照合」という評価アプローチは、自社でのPoC設計に直接応用できる。また、論文が提案する「人間承認ゲート型ハーネス」は、段階的導入において業務リスクを管理する現実的な設計思想として参照価値が高い。ベンダー評価時には汎用ベンチマークのスコアではなく、自社ERP環境での実測を求めることを検討すべきだ。

背景・経緯

コンピューター使用エージェント(スクリーンショットと模擬操作でPCを操作するAI)の性能は急速に向上しているが、その評価は汎用デスクトップ・Webタスクに偏っていた。ERPシステムは財務・調達・在庫・顧客管理を担う基幹インフラであり、高密度なインターフェース・複数ステップの協調操作・画面に表示されないデータエラーという固有の課題を持つ。本論文は2027年IEEE ICASSPへの投稿として審査中。