30秒サマリー
- 既存オープンソースコードから強化学習訓練タスクを自動生成するパイプライン「CodeMidas」の論文が公開された
- 23言語・15技術領域にわたる3,185リポジトリから5,545の訓練タスクを構築し、複数ベンチマークで性能向上を確認
- イシュー修正で+11.7%、プログラム全体構築で+17%など、多様なソフトウェアタスクで改善効果を実証
何が起きたか
2026年9月18日、Bowen Yeら19名の研究者がarXivに論文「CodeMidas: Scaling Agentic Coding RL Environments from Code Itself」を投稿した。同論文は、コーディングエージェントを強化学習(RL)で訓練するための環境を、既存オープンソースコードベースから自動生成するパイプラインを提案するものだ。
CodeMidasは、既存手法がGitHubのイシューやコミットといった開発成果物に依存するのに対し、ソースコード単体をタスク固有の入力として使用する点が特徴とされる。エージェントが実装済み機能を探索して仕様を定式化し、元コードの実行に基づくテストを構築し、実行チェックと繰り返しのソリューション展開を通じてタスクを検証・選別するという、各段階にエージェント的な計算を割り当てる設計となっている。
生成されたデータセットは、23のプログラミング言語と15の技術領域にわたる3,185のオープンソースコードベースから抽出した5,545の訓練タスクで構成される。このデータでMiMo-V2.5をGRPOを用いて訓練した結果、イシュー修正(DeepSWE)で+11.7%、プログラム全体構築(ProgramBench)で+17%、ターミナル作業(Terminal-Bench v2.1)で+8.5%の性能向上が5つの多様なベンチマーク全体で確認されたと論文は報告している。また、訓練済みエージェントはコードベース探索の増加や自己検証の多様化といった行動を示したとのアブレーション・軌跡分析も示されている。
原典ハイライト
論文のアブストラクトは「ソースコードは、多様なソフトウェアタスクにわたってコーディングエージェントを改善するRL環境構築のスケーラブルな基盤となる」と結論付けている。高品質な訓練タスク数の増加が性能向上につながるというアブレーション結果も示されており、データ規模の拡大に対する方向性が示唆されている。
出典: arXiv cs.AI(論文)
So What?(なぜ重要か)
従来のコーディングエージェント訓練は、イシューやコミット履歴といった特定の開発成果物に依存していたため、訓練データのスケールアップに限界があった。CodeMidasはソースコード自体を起点にタスクを自動生成することで、この制約を緩和しようとするアプローチだ。23言語・15領域にわたる広範なカバレッジは、単一ドメインに偏らない汎用的なコーディングエージェント開発の可能性を示唆する。ベンチマーク改善幅は領域によって異なるが、複数の評価軸で同時改善が確認された点は注目に値する。
日本企業への示唆
日本企業のエンジニアリング部門・AI導入担当者にとって示唆するのは、コーディングエージェントの実用性がデータ調達コストの課題を抱えていた状況が変わりつつあるという点だ。自社の既存コードベースが訓練データの源泉になり得るという発想は、プロプライエタリなコードを活用したドメイン特化エージェント構築への応用を検討する際の参考になるとみられる。ただし本研究はオープンソースコードを対象としており、社内コードへの適用可能性や品質・セキュリティ要件については別途検討が必要だ。コーディングエージェントの評価・導入を計画している企業は、訓練データの多様性とベンチマーク選定の重要性をあらためて確認しておくべき段階といえる。
背景・経緯
コーディングエージェントの強化学習訓練においては、多様かつ検証可能なタスクの確保が課題とされてきた。既存手法はGitHubのイシューやコミットを活用するケースが多いが、これらは特定の種類のタスクに偏る傾向がある。本論文はこの課題に対し、ソースコードそのものを出発点とすることでタスク生成のスケーラビリティを高めるアプローチを提案している。



