AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

Whisperの幻覚誤字起こしを再学習なしで92%削減する手法、arXivで発表

公開:2026年9月8日, 最終更新:2026年9月8日

30秒サマリー

  • 音声なし・無音入力でWhisperが誤った文字起こしを生成する「幻覚」問題に対し、再学習不要な推論時手法が提案された
  • デコーダの内部活性化を低ランク射影で制御し、幻覚率を平均31.31%から2.44%へ削減(92.21%相対削減)
  • 音声認識精度とのトレードオフは生じるが、ゲート制御方式で抑制と精度のバランスが調整可能

何が起きたか

2026年9月3日、Maryam Abbasihafshejani氏とMurtuza Jadliwala氏はarXiv(cs.AI)に論文を投稿した。対象は広く使われている音声認識基盤モデルWhisperで、音声がほとんどないまたは全くない入力に対して流暢な「幻覚」文字起こしを生成してしまう問題を扱っている。

提案手法は「幻覚空間射影(Hallucination Space Projection)」と呼ばれ、モデルの再学習を必要とせず推論時に適用できる点が特徴だ。無音などの非音声校正データから幻覚に関連するサブ空間を推定し、推論中にデコーダの隠れ状態をそのサブ空間から遠ざける低ランク射影を行う。

評価では「常時オン(always-on)」と「ゲート制御(gated)」の2方式を検証した。常時オン方式では非音声ベンチマークにおける幻覚率が平均31.31%から2.44%へと92.21%の相対削減を達成。ゲート制御方式はWhisperが非音声と判定した入力にのみ射影を適用し、幻覚率を3.74%(88.05%削減)に抑えつつ、正規の音声を誤拒否するリスクを低減した。一方、LibriSpeechでの実験では、ゲート制御方式によって単語誤り率(WER)が0.33〜4.39ポイント絶対値で増加し、誤拒否率(FRR)はモデル・分割設定により0.41〜9.97%となった。

原典ハイライト

論文は「低ランク活性化射影により、再学習なしでWhisperの幻覚を大幅に抑制でき、幻覚抑制と音声認識性能の間のトレードオフを制御可能にする」と主張している。幻覚率の92.21%相対削減という数値が核心的な成果である。

出典: arXiv cs.AI(論文)

So What?(なぜ重要か)

Whisperは法人向け議事録生成・コールセンター分析・医療記録など多くのビジネス用途で実運用されているが、無音や背景雑音のみの区間で存在しない発言が文字起こしされる幻覚問題は品質・信頼性の重大なリスクだった。本手法はモデルを再学習させずに推論時の処理だけで問題を大幅に緩和できるため、既存システムへの組み込みコストが低い。ただし音声認識精度との若干のトレードオフは生じるため、用途に応じた調整が必要となる。

日本企業への示唆

議事録自動化やコンタクトセンターの音声解析にWhisperを活用している日本企業にとって、幻覚誤字起こしはコンプライアンスリスクや後処理コストの原因となっていた。本研究の手法は再学習不要のため、現行の推論パイプラインに組み込むハードルが低く、短期的な品質改善策として検討する価値がある。ただし論文段階であり、実装の安定性や日本語音声への効果は原文では言及がないため、実用化には自社環境での検証が不可欠だ。

背景・経緯

WhisperはOpenAIが開発した自動音声認識(ASR)の基盤モデルで、その高精度から商用・研究用途で広く採用されている。生成型デコーダを採用するアーキテクチャの性質上、入力に音声信号が乏しい場合でも流暢なテキストを生成してしまう幻覚問題は以前から知られており、実運用上の課題となっていた。本論文はこの問題に対して追加学習なしで対処する手法として提案された。