30秒サマリー
- MicrosoftリサーチがAIエージェントの指示(スキル)を自動最適化するSkillOptを発表
- モデルの重みを変えずに6ベンチマーク・52評価セル全てで最高水準を達成
- 小規模モデル+最適化スキルで大規模モデルの無スキルベースラインを超える事例も
何が起きたか
Microsoftリサーチは、AIエージェントに与える「スキルファイル」(実行指示)を学習可能なパラメータとして扱い、自動最適化するフレームワーク「SkillOpt」を公式ブログで発表した。論文タイトルは「SkillOpt: Executive Strategy for Self-Evolving Agent Skills」。
SkillOptはモデルの重みを一切変更せず、エージェントが実行した軌跡データを基に別の最適化モデルがスキルファイルへの小規模な編集(追加・削除・置換)を提案する。提案された編集はホールドアウト検証セットで現行スキルを上回る場合のみ採用され、不採用の編集は後続の最適化に活用するネガティブフィードバックバッファに蓄積される仕組みだ。エポック単位のメタ更新も組み合わせることでスキルの「ドリフト」を抑制する。
SearchQA、SpreadsheetBench、OfficeQA、DocVQA、LiveMathematicianBench、ALFWorldの6ベンチマーク、GPT-5.5からQwen3.5-4Bまで7つのモデル、3種の実行モードを組み合わせた計52の評価セル全てで、SkillOptは最高または同率最高の結果を示した。GPT-5.5を直接チャットモードで使用した場合、6ベンチマーク平均スコアは58.8から82.3へ+23.5ポイント向上した。
転移性能も特筆される。Codex環境で訓練したスプレッドシートスキルをClaude Code環境に無調整で移植した実験では、スコアが22.1から81.8へと約60ポイント向上し、Claude Code環境で直接訓練した場合の80.4をわずかに上回った。また、GPT-5.4-miniに最適化スキルを適用した場合の平均スコア64.3は、より大きなモデルであるGPT-5.4の無スキルベースライン59.7を超えた。
原典ハイライト
原文によれば、最終的に採用されるスキルファイルの中央値は約920トークンで、検証ゲートにより大半の編集案が却下されるため1〜4件の編集のみが最終ファイルに反映される。OfficeQAでの+39.0ポイントの改善はわずか1件の採用編集によるものとされており、「ベテラン実務者のアドバイスのように読める」ルールが生成されると説明されている。
出典: Microsoft Research Blog(公式ブログ)
So What?(なぜ重要か)
これまでAIエージェントの性能改善には、モデルの再学習・ファインチューニング、あるいは専門家による手動のプロンプト調整が必要だった。SkillOptはその前提を覆し、「スキルファイル」という自然言語の設定ファイルを訓練対象とすることで、モデル本体に手を加えずに大幅な性能向上を実現する。さらに最適化済みスキルが異なるモデルや実行環境に転移可能であれば、「一度訓練して複数環境で再利用」という運用が現実的になる。
日本企業への示唆
日本企業がAIエージェントを業務システムに組み込む際、最大の障壁はモデルの再学習コストと運用中の品質劣化への対処だった。SkillOptが示す方向性は、「スキルファイル」という人間が読み書きできる軽量な層でエージェント動作を管理・改善するアプローチであり、AIモデルそのものに手を加えずとも継続的な精度向上が見込める。特に自動評価基準や検証環境を整備できる業務——受発注処理、スプレッドシート操作、文書審査など——では先行検証の価値が高い。また、スキルファイルがバージョン管理・監査可能な形で残る点は、コンプライアンス要件の厳しい金融・製造・医療分野での採用障壁を下げうる。ただし、現時点でオープンソース公開(GitHubリポジトリ)が示されており、自社環境での実証実験は比較的低コストで着手できると見込まれる。
背景・経緯
AIエージェントのスキル(実行指示)は従来、専門家の手書き、フロンティアモデルによるワンショット生成、実行後のゆるやかな自己修正という3つのアプローチで管理されてきた。原文はこれらがいずれも深層学習的な最適化ループを持たず、ステップサイズ制御や検証分割、失敗履歴の記憶を欠くことを問題点として指摘している。SkillOptはこの課題に対し、スキルを「モデル外部の訓練可能パラメータ」として再定義することで対処する研究として位置づけられる。




