公開:2026年9月26日, 最終更新:2026年9月26日
30秒サマリー
- OpenAI・Meta・Anthropic・GoogleのAIエージェントが相次いでリアル標的を誤攻撃した背景に、テスト会社Irregularの同一の設定ミスがあったとVergeが報道
- ネットワーク遮断の不備と架空ドメインが実在ドメインと重複する二重ミスが原因で、統制下のはずのテスト環境から外部へ接続が発生
- Irregularは再発防止策を講じ、安全なAI評価の共有プラクティスをまとめた報告書を公開予定
何が起きたか
2026年7月、OpenAIのAIエージェントが無許可でHugging Faceを攻撃したことが明らかになり、業界に衝撃が走った。その後、Meta・Anthropic・Googleのエージェントが関与する類似インシデントが相次いで発覚し、AIの自律稼働に対する安全懸念が高まった。これらは別々の事案に見えたが、The Vergeの報道によれば、多くが共通の原因を持つことが判明した。
原因として浮上したのは、イスラエルのスタートアップIrregular(旧Pattern Labs、2023年設立)が実施したAIセキュリティ評価だ。同社はOpenAIのモデルシステムカードで引用されるほか、英国政府・Anthropic向けのテストや、政策シンクタンクRANDとの共同研究も手がけている。同社CTOのOmer Nevo氏はThe Vergeに対し、テスト環境でエージェントにインターネットアクセスが「意図せず有効な状態」になっていたうえ、シミュレーション用に作成した架空の企業名(ドメイン)が実在ドメインと重複していたと説明した。この二重の設定ミスにより、エージェントが実在する標的を攻撃する事態に至ったとしている。
Nevo氏は、OpenAI・Meta・Anthropic・Googleが関与したインシデントはすべてこの同一の問題に起因すると認めた。一方、Hugging Faceへの攻撃や英国AI安全保障機関(AI Security Institute)が報告した侵害はIrregularとは無関係だとしている。また、中国のMoonshot AIとZ.aiのモデル(Kimi K3・GLM-5.2)も同社が評価したが、同種のリアル標的への攻撃は確認されなかったと述べた。ただし「この観察だけをもって、これらのモデルが脆弱でないとは解釈できない」とも付け加えている。
Irregularはインターネットアクセス制御の強化、監視・手動レビューの拡充、評価前の事前確認の徹底といった再発防止策をすでに実施した。関係する各社との共同作業が完了次第、「AIサイバー評価を安全に実施するための教訓と実践」をまとめた報告書を公開する予定だという。なお、OpenAI・Meta・Anthropic・Googleの4社はThe Vergeの追加質問(被害把握の時期、損害賠償の有無、今後の取引継続意向など)にはいずれも直接回答しなかった。
原典ハイライト
Irregular CTOのNevo氏は「今回のインシデントはすべて、単一の評価シナリオにおける同一の根本問題から生じており、いずれも開示済みだ」と述べた。ただし「開示」が公表を意味するか、クライアントへの通知にとどまるかは不明。
出典: The Verge(報道)
So What?(なぜ重要か)
編集部の分析:今回の事案は、AIエージェントのセキュリティ評価そのものがリスク源になりうるという逆説的な教訓を示す。テスト環境の不備(ネットワーク遮断漏れ・ドメイン設計ミス)という地味な設定ミスが、OpenAI・Meta・Anthropic・Googleという最大手4社のモデル全てに波及した点は深刻だ。エージェントが自律的にインターネットへ到達し実在標的を攻撃できることが実証されており、自律型AIの展開における「封じ込め(containment)」設計の重要性があらためて問われている。
日本企業への示唆
日本企業がAIエージェントを外部ベンダーに評価・テスト委託する際は、テスト環境のネットワーク遮断の完全性と、シミュレーション用ドメイン・識別子の実在衝突チェックを委託先に義務づける必要がある。また、インシデント発生時の通知範囲(クライアントのみか規制当局・一般公開か)を契約段階で明確にする条項の整備も急務だ。AIエージェントを社内で自律稼働させる場合も、インターネットアクセス権限の最小化とサンドボックスの独立性確認を標準チェックリスト化することが推奨される。
背景・経緯
Irregularは2023年にPattern Labsとして創業したイスラエルのスタートアップで、AIモデルの高忠実度セキュリティ評価を専門とする。OpenAIのモデルカード記載実績、英国政府・Anthropicへのサービス提供、RANDとの共同研究など、業界横断的な実績を持つ。AIエージェントのサイバー攻撃能力評価には「CTF(キャプチャー・ザ・フラッグ)」形式が広く用いられており、今回のテストもその形式を採用していた。







