公開:2026年9月9日, 最終更新:2026年9月9日
30秒サマリー
- トランスフォーマーで発見された「拒否応答」の表現ベクトルが、SSMなど異なるアーキテクチャにも転用可能であることを論文が示した
- 単一の剛体回転でモデル間の表現空間を整合させるだけで、安全プローブがアーキテクチャをまたいで機能することを実験で確認
- 新アーキテクチャへの安全機能移植は「再構築」でなく「書き込み地点での方向再推定」で済む可能性がある
何が起きたか
Preethi Carmel BoscoとGopalakrishnan Srinivasanの両氏は2026年9月4日、arXivに論文「Locating and Steering Refusal Beyond Attention」を投稿した。論文は、LLMの安全機能として知られる「拒否応答(refusal)」が残差ストリーム内の単一方向ベクトルとして存在し、トランスフォーマー以外のアーキテクチャでも同じ表現が成立するかを検証している。
実験では、一方のモデルの表現空間をもう一方に対して剛体回転(空間の形を変えずに向きだけを変える変換)で整合させると、トランスフォーマーで学習した有害入力検出プローブが状態空間モデル(SSM)の有害入力を正しく検出できたことが確認された。また、整合させた方向ベクトルを除去すると、本来拒否すべき攻撃にモデルが応答するようになる一方、同サイズのランダムなベクトルを除去してもその効果はほとんど見られなかったとしている。
アーキテクチャ固有の差異として論文が指摘するのは、方向ベクトルを「どこで読み取るか」という点だ。各層が残差ストリームへ加算する前の出力(論文の言う「書き込み地点」)で有害性が明確に検出できるとしており、介入の適用場所よりも推定場所が重要だと結論づけている。検出器トリガー型ゲートを用いた実験では、SSM・トランスフォーマー・リカレント・ハイブリッドの4アーキテクチャすべてでジェイルブレーク成功率が低下し、SSMではプロンプトを防御に合わせてチューニングした攻撃者に対しても有効性が維持されたと報告している。
原典ハイライト
論文は「安全ツールがアーキテクチャをまたいで機能する理由は、拒否方向そのものが転用できるからであり、防御の強度が転用できるわけではない」と整理し、新アーキテクチャへの移植は『その書き込み地点での方向再推定』で行えると結論づけている。
出典: arXiv cs.LG(論文)
So What?(なぜ重要か)
これまでトランスフォーマーを前提に構築されてきたAI安全・解釈可能性ツールが、SSMやハイブリッドモデルなど次世代アーキテクチャにも比較的少ないコストで転用できる可能性を示す研究として注目される。新アーキテクチャへの移行時に安全機能を一から作り直す必要性が低下するならば、モデル開発サイクルの短縮やセキュリティ運用の効率化につながりうる。ただし本論文は査読前のプレプリントであり、知見の確定には独立した検証が必要な点に留意が必要だ。
日本企業への示唆
生成AIを業務導入・調達する日本企業にとって、アーキテクチャの多様化(トランスフォーマーからSSMやハイブリッドへの移行)が安全対策のやり直しを必ずしも意味しないとする知見は、ベンダー選定や安全評価の基準設計に影響しうる。社内ガバナンス担当者は、採用モデルのアーキテクチャが変わった際に「拒否応答機能の継続性を技術的にどう確認するか」を調達・運用契約の評価項目に加えることを検討する価値がある。また、本研究が指摘するジェイルブレーク対策の限界(防御強度は転用できない)は、どのアーキテクチャを使っても敵対的プロンプト対策は継続的なモニタリングが必要であることを示唆している。
背景・経緯
トランスフォーマー型LLMの安全機能研究では、残差ストリーム内の単一方向ベクトルが拒否応答を制御するという知見が安全・解釈可能性ツールの基盤となってきた。一方、近年はMambaなどSSMベースのモデルやリカレント型・ハイブリッド型アーキテクチャが登場しており、これらに既存の安全知見がどこまで適用できるかは未解明だった。本論文はその空白を埋めようとした研究と位置づけられる。



