AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

350億規模MoEをSSD+24GBマシンで動かす推論エンジン「Edge0」論文

30秒サマリー

  • arXiv論文がMoEモデルをSSDから直接推論するエンジン「Edge0」の手法を発表
  • 24GB・単一マシンで35Bクラスを毎秒20トークン、ピークVRAM3GBに抑える
  • フレームワーク・チェックポイント・アダプタはオープンソースで公開

何が起きたか

2026年9月16日、Yu Linら5名の研究者がarXivに論文「The Other Half of the Memory Wall: Serving 35B MoEs from SSD with Trained Routing Prediction」を投稿した。論文では、35Bクラスの混合エキスパート(MoE)モデルをコンシューマー向けハードウェア上でSSDを活用して推論させるエンジン「Edge0」を提案している。

従来のSSDオフローディングは、次の層のエキスパートを前の層の出力が出るまで決定できないため、読み込みを先行させられず速度上の恩恵が得られないという問題があった。Edge0はこれを「プレルーター(prerouter)」と呼ぶ機構で解決する。各層に設けられた予測ヘッドが1トークン先の次層ルーティングを事前に予測し、その予測をルーティング結果そのものとして使用することで、SSDからのエキスパート読み込みをコンピュート処理に隠蔽する設計だ。

精度面では、int4量子化とルーティング置換による品質低下を補うため、「unmerged recovery LoRA」を学習させている。実験結果として、24GBの単一マシン上で35B MoEモデルを毎秒20トークンで推論でき、ピークアクティブメモリは3GiB以内に収まる。5つの公開ベンチマーク平均でfp16の教師モデルとの差は数ポイント以内だと報告されている。8Bクラスのモデルも同じフレームワークで動作する。フレームワーク、チェックポイント、アダプタはオープンソースとして公開されているとしている。

原典ハイライト

「プレルーター」が1トークン先のルーティングを予測してSSD読み込みをコンピュートに隠蔽し、ピーク3GiBのVRAMで35Bモデルを毎秒20トークン推論。recovery LoRAでfp16比数ポイント以内の精度を維持と報告。

出典: arXiv cs.AI(論文)

So What?(なぜ重要か)

これまで高性能GPU(80GB超のVRAMが必要なケースも多い)が前提だった大規模MoEモデルの推論が、24GB・SSD搭載のコンシューマー機で現実的な速度で動く可能性を示した点が本質。クラウドGPUコストを大幅に圧縮できる技術的方向性として注目される。ただし本論文はarXivへの投稿段階であり、査読を経た成果ではない点に留意が必要。

日本企業への示唆

生成AI活用の最大コスト要因の一つが推論インフラ費用である日本企業にとって、オンプレミスの廉価なワークステーションや既存PCサーバーで35Bクラスのモデルを動かせる可能性は、PoC・社内専用モデルのコスト試算を根本から変えうる。オープンソース公開済みとされるため、技術部門での検証は比較的低い参入コストで開始できる。一方で精度の「数ポイント差」が業務要件を満たすかどうかは用途依存のため、本番適用前に自社タスクでのベンチマーク評価が不可欠。

背景・経緯

MoEアーキテクチャは大規模言語モデルの効率化手法として広まっているが、推論時に多数のエキスパートモジュールをメモリに保持する必要があり、コンシューマーグレードのハードウェアでは「メモリウォール」と呼ばれるボトルネックが生じていた。SSDへのオフローディング自体は既存の研究でも試みられていたが、レイテンシ隠蔽の難しさが実用上の障壁となっていた。本研究はその課題をルーティング予測の先行実行で解決しようとするアプローチをとっている。