AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

再学習不要でMoEモデルの推論コストを半減、精度低下を最小化する手法をarXivで発表

公開:2026年9月9日, 最終更新:2026年9月9日

30秒サマリー

  • 整数パラメータ1つを追加するだけで、MoEモデルの有効化エキスパート数を半減しつつ精度劣化を大幅に抑制する手法が提案された
  • Qwen3.6-35B-A3Bで標準手法では4.65ポイント低下するMMluスコアが、提案手法では0.35ポイント低下に留まった
  • 追加学習・パラメータ変更が不要なため、既存モデルをそのまま低コストで運用できる可能性がある

何が起きたか

Xing ChenとHengshuai Yaoは2026年9月4日、arXiv(cs.LG)に論文「Training-Free Halving of Activated Experts in Fine-Grained Mixture-of-Experts Models」を投稿した。論文は、細粒度のMixture-of-Experts(MoE)モデルにおいて、追加学習・パラメータ変更・実質的な計算オーバーヘッドなしに、推論時に有効化するエキスパート数を半減できる手法を提案している。

提案手法の核心は、ルーターが確率を再正規化する際の仕組みにある。通常、MoEモデルは推論時に上位k個のエキスパートを選んで確率を再正規化するが、これによりkを減らすとエキスパート出力のスケールが変化し、精度が大きく落ちる。提案手法では、実際に使うエキスパート数(k1)と、正規化の基準として参照するエキスパート数(k2)を分離する整数1つを導入することでこの問題を回避する。

実験では、Qwen3.6-35B-A3Bモデルにおいて有効化エキスパートを8から4に半減した場合、標準の再正規化ではMMluスコアが4.65ポイント低下するのに対し、提案手法(k2=16)では低下幅が0.35ポイントに抑えられた。また、11倍大きいQwen3.5-397B-A17Bでも同様の結果が再現され、10から5への半減で精度低下は0.55ポイントにとどまった。一方、再正規化を完全に除去すると精度が壊滅的に低下することも示されており、適切な参照質量の保持が不可欠だと論文は指摘している。

論文はさらに、パープレキシティと下流タスクの精度では最適なk2の値が異なること、エキスパートの「どれを使うか」という選択がエキスパートの重み付けよりも精度への影響が大きいこと、ルーティングがバランスよく分散している場合はエキスパートの刈り込み余地が限られることも分析している。

原典ハイライト

標準再正規化でMMluスコアが4.65ポイント低下する条件下で、提案手法(k2=16)を適用すると低下幅は0.35ポイントに抑えられ、ルーティング済みエキスパートの計算量は半減した。この効果は11倍規模の大型モデルでも再現されている。

出典: arXiv cs.LG(論文)

So What?(なぜ重要か)

MoEアーキテクチャは大規模言語モデルのコスト効率化の主流手法だが、推論時の活性化エキスパート数を単純に減らすと精度が大きく劣化するというトレードオフが課題だった。本論文が提案する手法は、再学習ゼロ・パラメータ追加なしにこのトレードオフを大幅に緩和できる可能性を示しており、実用上の意義は大きい。ただし本論文はarXivプレプリントであり、査読を経た知見ではない点に留意が必要。

日本企業への示唆

QwenシリーズなどのMoEベースの大規模モデルをAPIではなく自社インフラで運用している、または導入を検討している企業にとって、本手法は推論コスト削減の実践的な選択肢になりうる。再学習が不要なため、すでにファインチューニング済みのモデルにもそのまま適用できる点は特に有効だ。一方、論文はパープレキシティだけでチューニングパラメータを選ぶと最適値を見誤るリスクを明示しており、社内評価基準として実業務に近い下流タスクの精度指標を用意しておくことが重要になる。

背景・経緯

MoEモデルは全パラメータのうち一部のエキスパートのみをトークンごとに活性化することで、Dense(全結合)モデルに比べて推論コストを抑えながら大規模化できるアーキテクチャ。近年はQwenをはじめ多くの主要モデルがMoEを採用している。推論時のコスト削減手法として、有効化エキスパート数を減らすアプローチは理論上有望だが、既存の再正規化の仕組みとの相互作用が精度劣化の原因となることが本論文で初めて体系的に分析された、と著者らは主張している。