AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

LLMの分類・ルーティングで定義文より「ラベル名」が優先される脆弱性を論文が検証

30秒サマリー

  • LLMを分類器として使う際、選択肢の定義文よりもラベル名が判断を支配することを研究者が実証した
  • 定義文を全削除しても精度はほぼ変わらず、ラベルをA/Bに置き換えると精度が約15ポイント向上した
  • この問題の原因はモデルの重みではなくプロンプトの書式にあると特定され、対策法も提示された

何が起きたか

Seyedarmin Azizi氏ら3名の研究者は2026年10月1日、arXivに論文「Labels Override Definitions in Jev-Style Typed Decision Models」を投稿した。この研究は、LLMを分類器・ルーター・モデレーターとして利用する「Jev式型付き決定モデル」において、モデルが選択肢の「定義文」ではなく「ラベル名」に基づいて判断を下す傾向(オプションラベルバイアス)を体系的に検証したものだ。

研究チームはオープンウェイトの型付き決定モデル4種、Qwen2.5バックボーンによる3通りの回答読み取り方式、11の分類タスク、および定義文にのみルールが記述された合成ルーティングスイート「PolicyBench」を用いて実験を実施した。結果として、定義文を全削除しても精度はほとんど変化せず(laya-tdモデルで0.8487→0.8559)、一方で定義文のみでは精度が0.7971にとどまった。さらに選択肢ラベルをA・Bに置き換えると精度が+0.1511(95%CI: +0.1377〜+0.1646)向上した。

注目すべきは、比較対象の「von」というシステムでは同様のバイアスが観察されなかった点だ。両システムのコードベースを比較したところ、差異は選択肢の書式の一箇所のみであった。layaは「{ラベル}: {定義}」の形式で記述するのに対し、vonは定義のみを記述していた。この書式を双方向に変更する実験(モデルの重みは一切変更せず)により、layaの3チェックポイントすべてで精度の変化がゼロになり、vonにはラベルが定義と矛盾した場合に精度が0.8511から0.2281へ大幅に低下する効果が生じた。研究者たちはこの問題の原因を従来指摘されていた「制約付き決定ヘッド」ではなく、「プロンプトの描画(書式)」に特定した。また、自分のモデルがどちらのケースに該当するかを判定できる2コール方式のテストと、4種の緩和策の効果も論文内で示している。

原典ハイライト

「定義文を全削除しても精度はほぼ変わらず、ラベルをA/Bに置き換えると精度が+15ポイント向上した。原因はモデルの重みではなくプロンプト書式の一箇所の違いにある」というのが論文の核心的知見。

出典: arXiv cs.AI(論文)

So What?(なぜ重要か)

LLMを分類・ルーティング・モデレーションに活用する際、開発者が定義文に丁寧なルールを書き込んでも、ラベル名の持つ意味的な重みがその定義を上書きしてしまうリスクがある。これは意図したルールが実際には適用されないことを意味し、システムが「正しく動いているように見えて実は動いていない」状態になりうる。問題の所在がモデル構造でなく書式であることが判明したため、プロンプト設計の見直しだけで対処できる可能性がある。

日本企業への示唆

日本企業がLLMを社内ルーティング・コンテンツ審査・問い合わせ分類などに実装している場合、選択肢のラベル名が日本語として持つ既存の意味合いが、定義文で指定したビジネスルールを無効化している可能性がある。特に「重要」「緊急」「低優先度」などの意味を持つラベルを使っている場合は要注意だ。論文が提示する「2コールテスト」でまず自社モデルの傾向を診断し、問題がある場合はラベルを中立的な記号(A/Bなど)に置き換えるか、書式を定義のみに変更する対策を検討すべきだ。AIシステムの評価・検収においても、定義文の内容とラベル名を意図的に矛盾させるテストケースを加えることが有効とみられる。

背景・経緯

「Jev式型付き決定モデル」はルーティング・モデレーション・トリアージ向けにJevが導入したインターフェースで、その後オープン実装が登場したと論文は説明している。LLMを分類器として使う場合、ラベル文字列をスコアリングする形で同様の操作が行われる。従来の研究ではこの問題の原因がテキストデコーダの代わりに用いられる「制約付き決定ヘッド」にあるとされていたが、本論文はその解釈に異議を唱えている。