AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

バイトモデルが大規模計算でトークンモデルを凌駕、知識蒸留で効率化も実証

公開:2026年9月14日, 最終更新:2026年9月14日

30秒サマリー

  • 約10億パラメータのバイトモデルが十分な計算量のもとでトークンモデルの性能上限を突破できると判明
  • 新手法「End-Of-Token」により、トークンのロジットをバイトのロジットへ正確に変換する蒸留が可能に
  • 蒸留バイトモデルはトークンモデルの6分の1のデータで同等性能を達成し、ストレージコストも約5分の1に削減

何が起きたか

Meta・ワシントン大学らの研究者7名(Kalyani Maratheほか)が2026年9月11日、arXivに論文「Breaking the Token Ceiling: Distilling Smaller, Stronger Byte Models」を投稿した。同論文は、約10億パラメータのデコーダ専用密トランスフォーマーモデルを対象に、トークン化方式(トークン/バイト/Bytes w/ eot)と学習目的関数(蒸留/交差エントロピー)の2軸を同時に変化させた初の大規模オーバートレーニング比較研究を報告している。学習データ量は最大1兆バイトに及ぶ。

研究では、トークンのロジットをバイトのロジットへ変換する2つの新手法を導入した。近似変換の「Marginalize-It」と、完全変換の「End-Of-Token(eot)」である。多肢選択QA・言語生成・機械翻訳の3カテゴリ計8ベンチマークで評価したところ、計算量(FLOP)が少ない段階ではトークンモデルが優位だが、計算量が増えるとバイトモデルがトークンモデルを逆転し、最終的には高い性能上限に到達することが確認された。

スケーリング則の外挿によると、蒸留したEnd-Of-Token-1Bは蒸留Token-1Bより漸近的に最大4%高い精度を達成するとみられる。また、256バイトの小語彙を用いるためロジットダンプ時のtop-k打ち切りが不要となり、ロジットのストレージコストはトークンモデルの約5分の1に抑えられる。さらに、スケーリング則に基づく予測では、蒸留End-Of-Token-1BはLlama 3.2-1B・Gemma-3-1B-pt・Gemma 2Bをそれぞれ最大6.5%・8.1%・2.1%上回るとされている。

原典ハイライト

論文アブストラクトによると、蒸留バイトモデル(End-Of-Token-1B)はトークンモデルの6分の1の学習データで同等の性能を達成し、漸近的には最大4%の精度向上と約5分の1のストレージコスト削減を実現するとされている。また、既存の著名1Bクラスモデルを複数のダウンストリームタスクで上回るとの予測も示された。

出典: arXiv cs.CL(論文)

So What?(なぜ重要か)

小型言語モデル(SLM)の実用展開において、トークナイザーへの依存を排したバイトモデルが計算・データ・ストレージの三面で優位に立てることを大規模実験が示した点は重要だ。特に「計算量が増えるほどバイトモデルが有利」というスケーリングの逆転現象は、モデル選択戦略に再考を促す。エッジデバイスやオンプレミス環境など、ストレージや多言語対応が課題となる場面での採用可能性が広がるとみられる。

日本企業への示唆

日本企業がオンプレミスや端末上での小型モデル運用を検討する際、バイトモデルはストレージコストの大幅削減(約5分の1)と多言語・低リソース言語への対応力向上という二つの実務的メリットをもたらす可能性がある。特に日本語のような非ラテン系言語はトークナイザーの語彙設計に依存するリスクが高く、バイト単位の処理はその制約を回避できる。ただし本論文はあくまで研究段階の成果であり、プロダクション適用には追加検証が必要。今後のオープンソースモデル選定やMLOpsのインフラ設計において、バイトモデルの動向を注視することが推奨される。

背景・経緯

言語モデルは通常、単語や部分語をトークンとして扱うが、語彙サイズが数万〜10万規模になるため、ロジットのストレージや多言語対応に課題がある。バイトレベルモデルは語彙を256に絞ることでこれを回避できる一方、計算効率の低さが課題とされてきた。本研究はその課題に知識蒸留とスケーリング則の観点から正面から取り組んだ初の大規模研究とされている。