AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

PC操作AIに安全判断を組み込む新手法「SCOPE」、タスク成功率54%・攻撃回避率64%を達成

公開:2026年9月23日, 最終更新:2026年9月23日

30秒サマリー

  • GUIを操作する自律型AIエージェントに「危険なら拒否する」判断力を持たせる訓練手法SCOPEを研究チームが論文発表
  • タスク実行能力と安全判断を同時に最適化し、既存手法の中で能力・安全性の総合スコア最高値58.80%を記録
  • 「拒否」と「リスク回避しつつ続行」の2種の安全軌跡が補完的な役割を担うことも明らかに

何が起きたか

Zeyu Kangら8名の研究チームは2026年8月27日、arXivに論文「Beyond Task Completion: Training Capable and Safe Computer-Use Agents」を投稿した。論文は、GUI(グラフィカルユーザーインターフェース)を通じて複雑な操作を行うComputer-use agents(CUAs)が、タスク完了の成功率だけを訓練指標にすると信頼できる安全行動を獲得できないという問題意識を出発点にしている。

研究チームが提案するのは「SCOPE(Safety and Capability Optimization for Policy Execution)」と呼ぶ手法で、タスク実行能力と安全判断の両方を同時に後訓練(post-training)する。あわせて「SCOPE-Gen」という自動化パイプラインを開発し、検証可能なタスクを生成するとともに、同一の目標を持ちながら環境リスクの有無が異なる「ペア」に変換することで訓練データを整備する。これにより構築したデータセット「SATraj-OS」は、①通常のタスク実行軌跡、②安全な継続軌跡、③明示的な拒否軌跡の3種で構成される。

SCOPEはこれら3種の軌跡を使った教師ありファインチューニングを行った後、オンライン強化学習でタスク完了能力をさらに向上させる。ベースモデルにQwen3.5-9Bを用いたSCOPE-RLは、ベンチマーク「OSWorld」でタスク成功率54.17%、安全性評価ベンチマーク「OS-BLIND」で攻撃回避率64.30%を達成し、評価対象エージェントの中で能力と安全性の総合スコア58.80%が最高値になったと論文は述べている。アブレーション実験からは、拒否軌跡が攻撃回避の向上に最も貢献し、リスク回避しつつ継続する軌跡は攻撃回避水準を保ちながらタスク実用性を高く維持する、という非対称かつ補完的な役割分担が明らかになった。

原典ハイライト

「信頼できるCUAはリスクに応じて実行を条件付けなければならない。通常の良性タスクは完了し、安全な完了経路が存在すれば環境上の危険を回避しつつ継続し、目標が有害または安全な経路が存在しない場合は拒否する」と論文は定義している。この3分類の条件付きポリシーを学習させる点が本手法の核心。

出典: arXiv cs.LG(論文)

So What?(なぜ重要か)

「タスクをこなせる」だけでなく「危険なときに止まれる・断れる」という条件付き判断能力の訓練が、自律型AIエージェントの実用展開において不可欠であることを示した研究。単一の成功指標だけで訓練されたエージェントは環境リスクや悪意ある指示に対して脆弱になる可能性があり、安全性と能力を同時最適化するアーキテクチャ設計の必要性を具体的数値で裏付けている。

日本企業への示唆

PC操作の自動化やRPA的なエージェント導入を検討する日本企業にとって、「何をさせるか」と同時に「何を拒否させるか」の設計が重要になる。SCOPEの枠組みは、訓練データに拒否シナリオとリスク回避シナリオの両方を含めることが安全性確保の実装上の鍵であることを示しており、社内業務エージェントの調達・評価基準を見直す際の参考になる。ベンダー選定時には、能力評価と安全評価を別々のベンチマークで検証するよう要件化することが望ましい。

背景・経緯

GUIを操作するAIエージェント(CUAs)はウェブブラウザや各種アプリを人間のように操作できるとして研究が活発化している。しかしこれまでの後訓練はタスク成功率の最大化に偏りがちで、有害な指示への対応や環境上のリスク回避といった安全行動を体系的に組み込む手法は十分に確立されていなかった。本論文はこのギャップを埋める実装アプローチとして提案されており、使用ベースモデルはオープンなQwen3.5-9Bである。