AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

AIエージェント訓練精度を高める「GraphForge」フレームワーク、arXivで論文公開

30秒サマリー

  • 実ファイルを使ったエビデンスグラフで、業務AIエージェントの訓練タスクを自動生成・検証するフレームワーク
  • Qwen3.6-27Bを2,169件のトラジェクトリで微調整し、複数ベンチマークで大幅な性能向上を確認
  • データとモデルは公開予定で、社内業務自動化エージェントの開発精度向上への応用が期待される

何が起きたか

2026年9月30日、Su Qishengら12名の研究者がarXiv(cs.CL)に論文「GraphForge: Training Working Agents with Graph-Anchored Workspace Synthesis」を投稿した。

GraphForgeは、多様なファイルの読み取り・ツール操作・成果物生成を行う「ワーキングエージェント」の訓練用タスクデータを生成するフレームワークである。従来手法の課題として、モデルで生成したファイルはリアリティと多様性に欠け、実ファイルを使った場合はタスク固有の検証機構がなく品質担保が困難だった点を論文は指摘している。

GraphForgeは職業起点のシードから実ファイル群を集めたワークスペースを構築し、ファイル間の関係を「エビデンスグラフ」として整理する。タスク要件と採点基準(ルーブリック)はこのグラフから導出されるため、各評価基準が実ファイルに紐付けられ検証可能となる。初期実行で動作確認を行い、不備があればリビジョンエージェントが修正した上でトラジェクトリを収集する仕組みだ。

実験では、2,169件のGraphForgeトラジェクトリでQwen3.6-27Bを教師あり微調整(SFT)した結果、OpenHands環境のGDPValが1445.7(+65.7)、Claude Code環境のWorkspace-Bench-Liteが63.7(+7.7)、SpreadsheetBench IIが24.0(+13.7)に向上した。さらにエビデンス紐付きルーブリックで候補を選別したリジェクション微調整(RFT)を重ねると、3つのベンチマーク全てで追加改善が得られたとしている。データとモデルは公開予定とされている。

原典ハイライト

エビデンスグラフによりタスクと検証基準の両方を実ファイルに根拠付けることで、業務エージェント訓練データの品質問題を解消するアプローチを提示。ルーブリックがリジェクション微調整の有効な選別シグナルとなることを実験で示した点が核心。

出典: arXiv cs.CL(論文)

So What?(なぜ重要か)

業務エージェントの訓練において最大の障壁の一つは「品質保証された大量の訓練タスク生成」だった。GraphForgeはこのボトルネックを、実ファイルとエビデンスグラフの組み合わせで解消しようとするアプローチであり、エージェントの精度向上サイクルを加速できる可能性がある。複数の著名ベンチマークで数値改善が確認されており、実用性の根拠として注目に値する。

日本企業への示唆

社内業務自動化エージェントの開発を検討する日本企業にとって、訓練データの質と検証可能性はコア課題となる。GraphForgeの手法は、自社の実ファイル(稟議書、スプレッドシート、メール等)を活用しながら検証可能なタスクを自動生成するパイプライン構築の参考になりうる。データとモデルが公開予定であることから、SIerやAIスタートアップはこのフレームワークを基盤に独自業務向けエージェントを試験開発する選択肢を早期に検討したい。一方、論文段階であり社内実装には技術的評価が必要な点に留意が必要。

背景・経緯

業務処理型AIエージェント(ファイル操作・ツール連携・成果物生成)の研究は急速に進んでいるが、訓練に必要な高品質タスクデータの生成パイプラインは乏しかったと論文は述べている。既存手法の「モデル生成ファイル」と「実ファイル+検証なし」という二択の限界を克服することが本研究の出発点となっている。