AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

強化学習でシェル操作300回超をこなすAIエージェント「T1」論文公開

30秒サマリー

  • 122Bパラメータ規模のMixture-of-ExpertsモデルT1が、クラウド上の実シェルを操作し長時間タスクを自律実行
  • Terminal-Bench 2.1で43.8%→64.0%へ精度向上、GPT-5.4やGLM-5.1を上回る結果
  • 訓練安定化の独自技術「TITO」「R3」により学習効率を大幅改善したことを論文で詳述

何が起きたか

2026年9月10日、Junyao Yangら7名の研究者がarXivに論文「T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks」を投稿した。T1は総パラメータ数122BのMixture-of-Experts(MoE)モデルであり、強化学習によって訓練されている。クラウドサンドボックス上の実際のシェル環境を操作し、1タスクあたり300回以上のツール呼び出しを実行できる点が特徴で、コーディングや科学的発見などの長時間タスクへの適用を想定している。

訓練手法として、論文では3つの主要な工夫を紹介している。第一に、Actor-Critic学習を安定させるためのアグレッシブなウォームスタートと、検証器の合格数を密に評価するプロセス報酬設計。第二に、「TITO(Training on Identical Token Orderings)」と呼ばれる手法で、サンプリング時のトークン識別子をそのまま訓練に使用しターン境界でのドリフトを修正するとともに、各MoEレイヤーのエキスパート選択をロールアウト時に記録して訓練時に再現する「ロールアウトルーティングリプレイ(R3)」を組み合わせた。TITOとR3により、学習時と推論時の対数確率差が0.021から0.013へ低減したと報告している。第三に、ベンチマーク過学習を避けるため、Terminal-Bench 2.1と重複しない完全アウト・オブ・ディストリビューションの訓練データを使用している。

性能評価では、ベースモデルの43.8%からT1が64.0%へとTerminal-Bench 2.1のスコアを引き上げた。また長時間タスク向けのLong-Horizon Terminal Benchでは27.9%を達成し、GPT-5.4およびGLM-5.1を上回ったと論文は報告している。なお、本論文はarXivへの投稿段階であり、査読を経た論文誌への掲載可否は原文では言及されていない。

原典ハイライト

T1はクラウドサンドボックス上の実シェルを最大300回超のツール呼び出しで操作する122B MoEモデル。TITOとR3により訓練安定性を高め、Terminal-Bench 2.1で64.0%・Long-Horizon Terminal Benchで27.9%を記録し、GPT-5.4・GLM-5.1を超えたと報告。訓練データはベンチマークと完全に分離し汎化能力を検証している。

出典: arXiv cs.LG(論文)

So What?(なぜ重要か)

「300回超のシェル操作」という数字が示すのは、AIエージェントが単純な一問一答を超え、複数ステップにわたる実務的な作業を自律的にこなせる水準に近づきつつあるという研究上の進展だ。強化学習とプロセス報酬の組み合わせ、MoEアーキテクチャの訓練安定化技術は、今後の実用エージェント開発における重要な参照点となりうる。ただし本成果は査読前論文であり、独立した再現検証はこれからの段階とみられる。

日本企業への示唆

日本企業がAIエージェントの業務導入を検討する際、「何ステップの作業を自律実行できるか」が選定基準として浮上しつつある。T1の研究はコーディングや調査・分析など長時間タスクへの適用可能性を示唆しており、社内ツールのシェル操作自動化やデータエンジニアリング補助といった用途が現実的な検討対象になってくるとみられる。一方で、クラウドサンドボックス上での動作前提・セキュリティ設計・ハルシネーション対策など運用上の課題も残るため、査読結果や実環境での再現性を見極めたうえで技術採用の判断を行うことが望ましい。

背景・経緯

AIエージェントの研究はこれまで比較的短いタスクを対象にすることが多かったが、近年はコーディングや科学的探索など複数ステップにまたがる「長時間タスク(Long-Horizon Tasks)」への対応が重要課題として浮上している。強化学習を用いてエージェントが実環境でツールを操作しながら学習する手法は活発に研究されており、本論文はその流れの中に位置づけられる。GPT-5.4やGLM-5.1といった比較対象モデルの詳細については原文では言及されていない。