公開:2026年10月2日, 最終更新:2026年10月2日
30秒サマリー
- ServiceNow CoreAIが、エンタープライズ向けAIエージェントの能力ギャップを自動的に訓練データへ変換するパイプライン「AutoSynthData」の技術詳細を公式ブログで公開した
- モデルの失敗パターンを特定し、より高性能な「教師モデル」の成功例と組み合わせて、実行可能・現実的・難易度適切な合成タスクを生成・検証する仕組みを持つ
- 単なるデータ生成にとどまらず、サンプル単位の品質検証とバッチ単位のカバレッジ管理を組み合わせ、訓練データの精度と多様性を担保する点が特徴
何が起きたか
ServiceNow CoreAIは2026年10月2日、Hugging Faceの公式ブログで、エンタープライズ向けAIエージェントの訓練データを自動生成するパイプライン「AutoSynthData」の詳細な技術解説を公開した。
AutoSynthDataは、対象モデル(ターゲットモデル)が苦手とするタスクを診断的評価によって特定し、より高性能な「教師モデル」の成功軌跡と比較することで「能力ギャップ」を抽出する。この情報を「能力仕様カード」として整理し、異なるプロンプト・初期状態・解法経路を持つ新たな訓練タスクを大量生成する設計となっている。生成フェーズは「ターゲット」と「マルチプライ」の2段階で構成され、コアサンプルを生成・検証した後、それをもとに多様なバリアントを展開する。
品質管理においては、各候補タスクに対してポジティブ検証(意図した解法がタスクを解けるか)とネガティブ検証(誤った結果が不合格になるか)を実施し、不合格となったタスクは「クリティック」による診断と修正ループを経て再検証される。さらに、バッチ単位のメタレビューによって特定タスク種の過剰生成や能力次元の欠落を検出し、次のバッチの生成戦略を動的に調整する。
本ブログでは、同社が別途公開した「EnterpriseOps Gym」(Malay et al., 2026)のデータセットを用いた実装例も紹介されており、パイプラインの動作を具体的に示している。ただし、AutoSynthDataのリリース時期や外部提供の有無については原文では言及がない。
原典ハイライト
「タスクの有用性には実行可能性・現実性・難易度の三条件が必要であり、検証器(VeriFier)の設計次第で誤った行動への報酬や正しい行動へのペナルティが生じる」という指摘が、訓練データ品質管理の核心として示されている。また、モデルが改善するにつれてカリキュラムが「まだ苦手な領域」へ動的にシフトする設計が強調されている。
出典: Hugging Face Blog(公式ブログ)
So What?(なぜ重要か)
エンタープライズAIの課題は、汎用モデルの能力ではなく「自社固有の業務・ツール・ポリシーへの適応不足」にある。AutoSynthDataが示すアプローチは、モデルの失敗を直接訓練信号に変換する「自己診断型カリキュラム生成」であり、従来の手動データ収集に比べてスケールと反復速度で優位性を持つ。品質検証の多層設計は、合成データにありがちな「それらしいが実行不能・評価不正確なデータ」の混入リスクを構造的に低減する。
日本企業への示唆
日本企業が自社業務に特化したAIエージェントを構築・改善する際、最大の障壁の一つが「高品質な訓練データの調達コスト」である。AutoSynthDataが示す「失敗→診断→合成タスク生成→検証」のサイクルは、社内システムや業務フローを環境として定義できれば、人手によるデータラベリングを大幅に削減できる可能性を示唆する。特にERPやITSMなどの業務システムと連携するエージェント開発を検討する企業は、訓練データ戦略としてこのような合成データパイプラインの導入を検討する価値がある。一方で、環境の正確なモデル化と検証器の設計は依然として専門的な実装工数を要する点に留意が必要だ。
背景・経緯
ServiceNow CoreAIは、ServiceNowのAI研究部門。原文によれば、本パイプラインはEnterpriseOps Gymと呼ばれるエンタープライズ向けエージェント評価環境と組み合わせて実装・検証されており、同環境のデータセットは公開済みとされている。AIエージェントの企業導入が進む中、汎用基盤モデルを自社環境に適応させるファインチューニング手法の需要が高まっており、合成データ生成はそのコスト削減策として注目されている。




