公開:2026年10月2日, 最終更新:2026年10月4日
30秒サマリー
- OpenAIは自社モデルの保護推論を不正抽出しようとする組織的キャンペーンを検知し、7月28日までに完全遮断した
- 攻撃の中核はMoonshot AI(Kimi開発元)に関連する人物と帰属評価。4,000超のユーザーから1万6,000件の抽出試行を観測
- OpenAIはFrontier Model Forumや政府機関との情報共有も実施し、業界全体での防衛強化を呼びかけている
何が起きたか
OpenAIは2026年9月30日付の公式ブログで、自社モデルの「保護推論(protected reasoning)」を不正に抽出しようとする組織的・協調的なキャンペーンを特定・遮断したと公表した。最初の活動は7月1日に観測され、7月24〜25日に急増。1万6,000件の抽出試みが4,000人以上のユーザーから行われ、関連するプロンプトパターンの活動は1万5,000人超のユーザークラスターに及んでいた。7月28日までに完全に遮断したという。
攻撃の手口は、暗号化された推論を別の会話に持ち込みモデルに復号させるなど、モデルとのやり取りを操作して保護推論を可視化するというもの。OpenAIのシステムへの直接侵入やデータベース侵害ではなく、モデルの挙動を悪用した手法であり、同社はこれをOpenAI固有の脆弱性ではないと強調している。独立したセキュリティ研究者も関連する脆弱性を責任ある開示を通じて報告しており、攻撃経路の実在を確認したとしている。
OpenAIは攻撃の中核クラスターについて、中国のAIスタートアップ「Moonshot AI」(AIアシスタント「Kimi」の開発元)に関連する人物と帰属評価していると明記した。ただし、観測されたすべての操作が単一アクターによるものかどうかは不明としている。対応措置として、不正アカウントの禁止・制限、技術的管理強化、第三者サービス事業者との連携、そしてFrontier Model Forumや政府の情報共有チャネルを通じた知見の共有を実施した。
原典ハイライト
「敵対的蒸留(adversarial distillation)は安全保障上のリスクをもたらす。抽出された推論は、元のモデルに適用された安全策を保持しないまま別のモデルの訓練に利用される可能性がある」とOpenAIは警告。攻撃者がすでに取得した暗号化推論を再生して内容を復元するパスウェイを閉鎖し、ストリーム出力の監視強化なども行ったと説明している。
出典: OpenAI News/Research(公式ブログ)
So What?(なぜ重要か)
今回の事案は、AIモデルの能力を正規の開発投資なしに低コストで模倣しようとする「モデル蒸留攻撃」が、組織的・大規模に実行される段階に入ったことを示す。抽出された推論にはモデルの最終回答には含まれない内情が含まれる可能性があり、安全策の迂回や能力の無断複製につながりうる。OpenAIは「フロンティアモデルが高度化するにつれ、攻撃もより巧妙になる」と見通しており、業界横断での防衛が不可欠な共通課題となっている。
日本企業への示唆
日本企業がOpenAIや類似のLLMをAPI経由で業務利用する場合、自社が運営するオペレーター環境やパートナー経由の展開環境が攻撃の経路になりうる点に注意が必要だ。OpenAI自身も「パートナーホスト型の展開は自社サービスと同等の保護が必要」と指摘しており、APIの利用規約遵守はもちろん、不審なアクセスパターンの監視体制やアカウント管理の強化を改めて点検すべきだろう。また、自社でAIモデルを開発・提供する企業は、推論プロセスの保護が知財・安全保障の観点から重要な経営課題であることを認識し、セキュリティ設計に組み込む必要がある。
背景・経緯
モデル蒸留とは、既存モデルの出力を教師データとして別のモデルを訓練する技術で、正当な手法としても広く使われる。今回問題とされたのは、OpenAIの利用規約に違反する形で保護推論を無断かつ組織的に抽出する行為。Frontier Model Forumは主要なAI企業が参加する業界団体で、安全・セキュリティに関する情報共有の枠組みとして機能している。OpenAIは今回の知見を同フォーラムや政府機関と共有し、他の開発者にも同様の防衛策の検討を促している。



