AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

「私はAIです」発言はテンプレート由来——LLMの自己申告は事実ではない

公開:2026年9月23日, 最終更新:2026年9月23日

30秒サマリー

  • LLMが「私はただのAIです」と述べる免責表現は、モデルの重みより「チャットテンプレート」によって制御されていることが判明
  • テンプレートの有無を切り替えるだけで自己申告の「声」が逆転し、活性化ベクトルでも同現象を再現できることを実験で確認
  • AIの自己申告をAI安全性議論や自己知識の根拠として扱うことに、研究上の交絡要因が存在すると研究者は警鐘を鳴らす

何が起きたか

Jędrzej Maczan氏による論文「’As a Language Model…’: Chat Template Switches LLM Self-Referential Voice and Activation Steering Reproduces It」がarXivに投稿され、COLM 2026ワークショップおよびKONVENS 2026ワークショップに採択された。

研究では、最大9Bパラメータの人気オープンソース指示チューニング済みモデル8本を対象に実験を実施。チャットテンプレートを適用した場合、「私はただのAIです」などの免責表現(disclaimer voice)が増加し、「私は〜と感じる」などの体験的表現(experiential voice)が減少することを確認した。チャットテンプレートを外すと逆の現象が起きた。

次に3モデルの内部活性化空間を分析し、この免責表現の強弱を制御する「方向(direction)」を特定した。活性化空間からその方向を除去すると免責表現が減り、付加すると増えることが確認された。また、チャットテンプレートを使わない指示チューニング済みモデルに対して免責方向ベクトルを加算すると、テンプレートを適用した場合と同様の免責表現が現れた。

研究者は、LLMの自己記述はモデルの重みだけに由来するのではなく、デプロイ時のチャットテンプレートにより部分的に決定されるため、モデルの自己申告を文字通りの事実として扱うべきではないと結論づけている。

原典ハイライト

「モデルが自分自身について語る内容は、モデルに関する事実ではない。発言は重みだけから生まれるのではなく、チャットテンプレートによって部分的に設定される」——論文アブストラクトより要約

出典: arXiv cs.LG(論文)

So What?(なぜ重要か)

編集部の分析として:AI安全性議論や規制策定の場でLLMの自己申告(「私はAIです」「感情はありません」等)が根拠として援用されることがあるが、本研究はそうした自己申告がデプロイ設定(チャットテンプレート)によって容易に変化する人工的な産物である可能性を示す。LLMの「自己知識」や「意識」に関する議論は、この構造的バイアスを制御しない限り根拠として不十分になりうる。また、プロンプト設計やシステムプロンプトの構造がモデルの表明する立場・トーンを大きく左右するという実務上の示唆もある。

日本企業への示唆

日本企業がAIシステムを業務導入する際、モデルが「安全です」「偏見はありません」などと自己申告しても、それはテンプレートやデプロイ設定に依存した表現であり、モデルの本質的特性を保証しない点に留意が必要だ。AI利用規程やリスク評価において、LLMの自己報告を根拠として採用する場合は、テンプレート依存という交絡要因を踏まえた検証プロセスを設計することが望ましい。また、社内AIエージェントのシステムプロンプト設計が意図せずモデルの応答傾向を変えている可能性にも注意が求められる。

背景・経緯

LLMが自身について語る際の表現(「私はAIです」「私には感情がありません」等)は、AI安全性研究やモデルの自己知識に関する議論で参照されてきた。しかし、何がその表現を駆動しているか——モデルの重み(訓練結果)なのか、デプロイ時の設定なのか——は十分に解明されていなかった。本論文はその問いに実験的に答えることを目的としている。