AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

テンセント、MoE型LLM「Hunyuan-A13B」の技術報告書をarXivに投稿

公開:2026年9月25日, 最終更新:2026年9月25日

30秒サマリー

  • 総パラメータ数800億・推論時アクティブ130億のMoEモデルをオープンソースで公開予定
  • 20兆トークンの厳選コーパスで事前学習し、数学・科学・コーディングで大規模モデルに迫る性能を報告
  • タスク複雑度に応じて思考深度を切り替える「デュアルモードCoT」を搭載

何が起きたか

テンセントのHunyuan Teamは2026年9月23日、Mixture-of-Experts(MoE)アーキテクチャに基づく大規模言語モデル「Hunyuan-A13B」の技術報告書をarXivに投稿した。同モデルは総パラメータ数800億を持つ一方、推論時に実際に活性化するのは130億パラメータにとどまり、モデル性能と計算コスト・デプロイコストのバランスを図った設計となっている。

事前学習には、STEM分野のデータを強化するなど厳格にフィルタリングされた20兆トークン規模のコーパスを使用し、事実精度と推論能力の向上を図ったとしている。さらに高品質な教師あり微調整(SFT)と大規模強化学習を組み合わせることで総合性能を高めている。

同モデルの特徴的な機能として「デュアルモード・チェーン・オブ・ソート(CoT)フレームワーク」が挙げられる。通常のクエリには迅速な「ファスト思考」を、複雑な多段階問題には深い「スロー思考」を適用し、タスクの複雑度に応じて推論の深さを自動調整する。論文によれば、数学・科学・プログラミング・一般言語理解・エージェントタスクにおいて、より大規模なモデルに匹敵する競争力ある性能を示すと評価されている。テンセントはオープンリサーチと実用的なLLMデプロイ支援を目的として、同モデルをオープンソースで公開するとしている。

原典ハイライト

論文アブストラクトは「推論スループットが高く、レイテンシを重視するアプリケーションに適する」と明記。MoEにより総800億パラメータを持ちながら推論時のアクティブパラメータを130億に抑えることで、計算効率とデプロイコストの低減を両立している点を核心的な技術優位性として示している。本報告書はarXivへの投稿論文であり、査読済み論文ではない。

出典: arXiv cs.AI(論文)

So What?(なぜ重要か)

MoEアーキテクチャにより、フル活性化型の大規模モデルと同等以上の性能を、推論コストを大幅に抑えながら実現できる可能性を示す事例となる。特にデュアルモードCoTはAPI呼び出しコストの最適化や応答速度の改善につながる設計思想であり、商用LLM選定の新たな評価軸を提示している。オープンソース公開により、商用APIに依存せず自社環境へのデプロイを検討する企業にとっての選択肢が広がる。

日本企業への示唆

日本企業がLLMを業務実装する際、GPUコストや応答速度がボトルネックになるケースは多い。Hunyuan-A13BのようなMoE型モデルは、大規模モデル並みの性能を低い推論コストで得られる可能性があるため、クラウドAPI費用の削減やオンプレミス・プライベートクラウドへの自社デプロイを検討している企業は技術評価の対象に加える価値がある。また、タスク難易度による動的な推論切り替え機能は、問い合わせ対応・社内ナレッジ検索・コード生成など複数用途を一つのモデルで賄う際のコスト最適化に応用できる。ただし、現時点はarXiv投稿の論文段階であり、日本語性能や実運用での安定性は別途検証が必要な点に留意されたい。

背景・経緯

テンセントはHunyuan系列のLLM開発を継続しており、本モデルはそのMoE特化版に相当するとみられる。MoEアーキテクチャはMistral・Googleなど複数の主要AI企業が採用しており、大規模パラメータを持ちながら推論コストを抑える手法として注目されている。本報告書はarXivへの投稿であり、査読済み論文としての位置づけではない。