AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

AIエージェントがLLM微調整を自律実行──GoogleがTPU活用の「autofinetune」手法を公式ブログで解説

30秒サマリー

  • GoogleがAIエージェントによるLLM後学習(ファインチューニング・強化学習)の自律反復実験手法「autofinetune」を公式ブログで解説した
  • Markdownで仕様を記述するだけで、エージェントが一晩中LoRAランクや学習率などを自動探索し、最良の設定をGitにコミットする
  • SFTと強化学習(GRPO)の2事例で有効性を示し、RLでは約40実験を経て報酬指標を約10%改善したと報告している

何が起きたか

Googleの開発者アドボケイト・Wei Wei氏は2026年9月11日付の公式ブログで、LLMのポスト学習(Supervised Fine-TuningおよびGRPOによる強化学習)をAIエージェントが自律的に反復実行する手法「autofinetune」を解説した。同手法は今年初めに公開された自律研究プロジェクト「autoresearch」の設計思想を後学習領域に応用したものであり、Tunix・Gemma・Cloud TPU・Antigravity CLI・Gemini Flash 3.7というGoogleのAIスタックを組み合わせて実装されている。

従来の後学習は「仮説立案→スクリプト編集→ジョブ投入→ロス曲線の監視→手動記録」という繰り返しの手作業サイクルを要していた。autofinetuneでは人間がMarkdown形式の仕様ファイル(program.md)で境界条件・評価基準・制約を定義し、単一のPythonスクリプト(run.py)を提供するだけで、エージェントが修正・実行・評価・コミット/リバートのループを自動的に回す。

事例1はCloud TPU v5e-1上でのSFT実験で、FunctionGemma-270M-ITをmobile-actionsデータセット向けに最適化。数時間で20回の自動実験を実施し、LoRAランク・オプティマイザ・学習率などを自律的に調整して関数呼び出し生成の精度を段階的に向上させたとしている。事例2はGemma 3 1BをGSM8Kで数学推論向けに強化学習(GRPO)する設定で、Cloud TPU v6e-1を使い2〜3日間・40実験を実施。数値精度とフォーマット精度の合計を評価指標とし、合計報酬を約10%改善したと報告している。コードおよびサンプル実行ログはGitHubのautofinefuneリポジトリで公開されている。

原典ハイライト

「Markdownの仕様を書いて眠れば、AIエージェントが一晩中数十回のファインチューニング実験を代わりに走らせ、最適なLoRAランク・学習率・バッチサイズを発見してGitにコミットしている」という書き出しが示すように、ブログは人間の介入を最小化した自律的ポスト学習ループの実現可能性と具体的な実装手順を詳細に解説している。

出典: Google Developers Blog – AI(公式ブログ)

So What?(なぜ重要か)

LLMのファインチューニングにおいて最も時間・工数を要するハイパーパラメータ探索と実験管理がエージェントによって自動化できることを、実際の実験データと共に示した点が重要である。これまで高度なMLエンジニアリング工数を必要としていた後学習プロセスが、仕様記述という上流作業に集約される可能性を示しており、LLM開発サイクルの大幅な短縮とコスト削減につながりうる。

日本企業への示唆

自社モデルや業務特化モデルの微調整を検討している日本企業にとって、MLエンジニアの稼働を大幅に圧縮できるアプローチとして参考になる。まず公開されているGitHubリポジトリのサンプルを検証し、自社のユースケース(例:社内文書QA・コード生成・業務ロールプレイ)に合わせたprogram.mdの設計スキルを社内に蓄積することが現実的な第一歩となる。Google Cloud TPUの利用が前提のスタックであるため、既存のクラウド調達方針との整合も事前に確認しておく必要がある。

背景・経緯

Googleは今年初め、LLMの事前学習を自律的に探索する「autoresearch」プロジェクトを公開しており、「autofinetune」はその後学習版として位置づけられている。後学習フレームワーク「Tunix」およびオープンモデル「Gemma」はGoogleが提供する既存のOSSライブラリ・モデルであり、本ブログはこれらを組み合わせた自律実験ループの実装方法を解説するhow-to記事として公開された。