AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

AIモデル自動構築エージェント「AIBuildAI-2.5」、MLE-Benchで首位獲得

公開:2026年9月23日, 最終更新:2026年9月23日

30秒サマリー

  • LLM誘導型ツリー探索でAIモデルを自律構築するエージェントシステムの論文がarXivに投稿された。
  • MLE-Benchでメダル獲得率73.3%を達成し、同ベンチマークで1位を記録したと論文は主張する。
  • 推論コスト削減・ハードウェア利用効率向上・探索精度改善の三課題を同時に解決する設計が特徴。

何が起きたか

2026年9月6日、Peijia Qinら6名の研究者がarXivに論文「AIBuildAI-2.5: Efficient Autonomous AI Model Development Through LLM-Guided Tree Search」を投稿した。著者の所属機関は原文では明示されていない。

AIBuildAI-2.5は、AIモデルの構築をコード探索問題として定式化し、LLMエージェントがツリー探索を実行するシステムだ。既存の同種エージェントが抱える三つの効率上の弱点——(1)限られた予算内での候補実行数の少なさによるノード選択精度の低下、(2)ハードウェアリソースを考慮しないジョブスケジューリング、(3)全タスクに高性能モデルを使うことによる推論コスト増——それぞれに対応する機構を備えると論文は説明する。

具体的には、「ジャッジ」が各候補プログラムの改善見込み・根拠・実現可能性をスコアリングし、「セレクター」がそのスコアと探索状態を組み合わせて次の候補を選ぶLLM誘導型ツリー探索を導入。加えて、現在のハードウェアリソース状況を踏まえてジョブを投入する「スケジューラー」と、難易度の低いサブタスクには低コストLLMを、最難関タスクには最高性能LLMを割り当てる「ルーター」を組み合わせる設計となっている。

論文によると、AIBuildAI-2.5はMLE-Benchにおいてメダル獲得率73.3%で1位を記録し、AIRS-Benchの自律AIリサーチタスク6件でも比較ベースラインを上回ったとしている。なお、本論文はarXivプレプリントであり、現時点で査読を経た学術誌への掲載は確認されていない。

原典ハイライト

論文アブストラクトは「LLM誘導型ツリー探索により、候補のスコアリング・ハードウェア対応スケジューリング・タスク難易度に応じたLLMルーティングの三機能を統合し、MLE-Benchで73.3%のメダル率を達成した」と核心をまとめている。

出典: arXiv cs.CL(論文)

So What?(なぜ重要か)

AIがAIモデルを自律的に開発する「AutoML型エージェント」の性能が、経験豊富なAIエンジニアに匹敵する水準に近づいてきていることを、本論文は改めて示している。特に注目すべきは、コスト効率への意識が設計の中核に据えられた点だ。推論コストの削減とハードウェア利用率の最適化を同時に追求することで、大規模なGPUリソースを持たない組織でも自律的なモデル開発が現実的な選択肢になりつつある方向性を示唆している。ただし本成果はプレプリント段階であり、独立した再現検証はまだ行われていない。

日本企業への示唆

日本企業にとって最大の示唆は「AIモデル開発の内製コスト構造が変わりうる」という点だ。自律型エージェントが探索・学習・評価を自動化できるなら、専門的なMLエンジニアの工数を一部代替できる可能性がある。一方で、こうしたシステムを導入・運用するにはベンチマーク評価の読み解き力や、エージェントの出力を検証する人材が依然必要となる。自社のAI開発ロードマップにAutoML・エージェント型開発ツールを組み込むかどうか、技術動向の継続的な把握が求められる段階に入ってきている。まずはMLE-BenchやAIRS-Benchといった標準ベンチマークの意味を社内で理解することから始めることが実務的な第一歩となろう。

背景・経緯

AIモデルの構築を自動化する研究は「AutoML」や「Neural Architecture Search」として長年進められてきた。近年はLLMの高い推論・コード生成能力を活かし、モデル構築全体をコード探索問題として解くエージェント型アプローチが注目を集めている。原文は、この系譜の先行研究がすでにリアルなベンチマークで経験豊富なAIエンジニアに匹敵しつつあると述べており、AIBuildAI-2.5はその上でさらに効率性を高めることを目的として開発されたと説明している。著者の所属や資金源については原文に記載がない。