AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

975BパラメータAIを11台のPCで動かす分散推論手法をarXivで発表

公開:2026年10月8日, 最終更新:2026年10月8日

30秒サマリー

  • Not Community Labs社とIntelの研究者が、975Bパラメータの大規模MoEモデルをIntel製AI PC 11台のクラスターで動作させる手法「Cascadia」を論文発表
  • 各PCは64GBメモリ・統合GPU・ギガビットEthernetのみで構成し、データセンター不要のローカル分散推論を実現
  • 88並列ストリームで毎秒60.29トークンの集計デコード速度を計測、クラウドなしの大規模モデル実行の実現可能性を示した

何が起きたか

Not Community Labs社のTate Berenbaum氏、Matias Parij氏、およびIntel CorporationのMuthaiah Venkatachalam氏は2026年10月5日、arXivに論文「Cascadia」を投稿した。同論文は、総パラメータ数975B(アクティブパラメータ41B)のMixture-of-Experts(MoE)モデル「Inkling」を、市販レベルのIntel Core Ultra X7 358H搭載AI PC 11台で動作させる分散推論フレームワークを報告している。

各PCのスペックは64GBメモリ、Arc B390統合GPU、ギガビットEthernetのみ。クラウドやデータセンター級ハードウェアを使用しない点が特徴だ。実装では、各マシンに6層分のデコーダー層を割り当て、OpenVINOの統合GPU向け最適化プリミティブを活用したカスタムMoEエンジンを開発。密な層(dense layer)の呼び出し時間を約8.1msから4.5msへと削減したと報告されている。

性能計測では、1〜176の15段階の並列ストリーム数で評価を実施。88並列ストリーム時に集計デコード速度60.29トークン/秒、全サービスフェーズ通算で46.87トークン/秒を記録した。15ストリーム時の最初のトークン生成までの中央値レイテンシは6.05秒。コンテキスト長は最大512Kポジション(ストリームあたり)に対応し、1k〜64kトークンの実プロンプトで19件の回答すべてから埋め込みコードを正確に抽出できたとしている。ボトルネックはメモリではなくシングルスレッドのCPUアテンションループにあることも確認されている。

原典ハイライト

論文は「Mixture-of-Expertsモデルはスパース計算によりほぼ兆パラメータ規模の容量を利用可能にする」と前置きした上で、11台のPC上で分散MoE推論を動作させるエンジン設計・パイプライン・評価手法を詳細に記述。FP16エキスパート計算とFP32出力復元の組み合わせや、ドラフト評価による語彙選択と重み量子化の影響分離など、実用的な実装知見が核心となっている。

出典: arXiv cs.AI(論文)

So What?(なぜ重要か)

これまで兆パラメータ級のAIモデルを動かすにはGPUサーバークラスターやクラウドインフラが必須とされてきた。本研究は、市販AI PCをギガビットEthernetで束ねるだけで975Bパラメータ規模のモデル推論が成立することを実測値で示した。データをクラウドに送れない業種・場面でも大規模モデル活用の扉が開く可能性を示す研究として注目される。ただし現時点はarXiv掲載の研究段階であり、実用製品化の時期・条件は論文では言及されていない。

日本企業への示唆

金融・医療・製造などデータをクラウド外に出せない日本企業にとって、オンプレミスで超大型AIモデルを動かす選択肢が現実味を帯びてくる可能性がある。必要なハードウェアが「市販AI PC×台数」という構成であれば、初期投資や調達の柔軟性が高まる。一方で、現状は最初のトークン生成に6秒超かかるなどレイテンシ面の課題も残る。IT部門としては、(1)自社のユースケースがバッチ処理寄りかリアルタイム寄りかを見極めること、(2)MoEアーキテクチャと分散推論技術の動向を継続注視すること、が当面の実践的アクションとなる。

背景・経緯

MoEモデルは推論時にパラメータの一部のみをアクティブにするアーキテクチャで、全パラメータを毎回使う密なモデルと比べ計算コストを抑えながら大規模な容量を持てる利点がある。これを分散クライアント環境で実行する研究は新興領域であり、本論文はその実行・評価アプローチを提示した位置づけとみられる。IntelはOpenVINOなど推論最適化ツールを持ち、AI PC市場への注力を続けている。