AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

表1枚を64トークンに圧縮、文書QAのコスト41%削減——arXiv論文

公開:2026年8月30日, 最終更新:2026年8月30日

30秒サマリー

  • VLMを使い複数表を含む長文書への質問応答で、トークン数を41%削減しつつ精度を7ポイント向上する手法を提案
  • 表を低解像度画像で粗く読み取り関連表を絞り込んだ後、該当表のみネイティブ解像度で詳細推論する2ステップ方式
  • 追加学習不要(training-free)で既存VLMに適用可能な点が実用上の強み

何が起きたか

エディンバラ大学のIñigo AlonsoとMirella Lapataは2026年8月27日、arXivに論文「A Table Is Worth 64 Tokens」を投稿した。論文は、テキストと複数の表が混在する実務文書に対してVLM(視覚言語モデル)で質問応答を行う際のトークンコスト削減手法を提案・評価したものである。

研究では、表を画像として表現する「光学的コンテキスト圧縮」に着目。5種類のVLMと2つのベンチマーク、5段階のビジュアルトークン予算を用いた実験を実施した。その結果、表をネイティブ解像度で画像化した場合はテキスト表現と同等の性能・効率を示す一方、表を縮小すると可読性の低下をモデルが長い推論トレースで補おうとし、コスト削減効果が相殺されることが判明した。

ただし大幅に縮小した表でも「質問に関連する表かどうかの判別」には十分な情報が残ることも確認された。この非対称性を利用した2ステップ手法を提案:①まず低解像度の圧縮コンテキストで関連表を特定し、②その表だけをネイティブ解像度で再読み込んで推論する。追加学習は不要。長文書における実験では、ネイティブ解像度での単一ステップQAと比べてトークン総数を41%削減しながら精度を7ポイント向上。最も効率的な単一ステップ圧縮構成と比べても精度を落とさずにトークンを15%削減した。

原典ハイライト

「高度に縮小された表でも、その表が質問に関連するかどうかを判断するのに十分なシグナルを保持している」という発見が本手法の核心。この非対称性を活用した2ステップの推論フロー(粗い絞り込み→詳細推論)により、追加学習なしでトークン41%削減・精度7ポイント向上を同時達成した。

出典: arXiv cs.AI(論文)

So What?(なぜ重要か)

LLM/VLMの利用コストはトークン数に直結するため、表を多く含む金融報告書・契約書・データシートなどを扱う業務では本手法のような選択的解像度制御が実用上の意義を持つ。既存モデルへの追加学習なしで適用できる点は、エンタープライズ導入の障壁を下げる。ただし本論文はプレプリントであり、査読を経た知見ではない点に留意が必要。

日本企業への示唆

財務資料・仕様書・規制文書など表が多い文書をAIで処理するケースでは、APIコストとレイテンシの削減余地が大きい。本手法のように「粗い絞り込み→詳細処理」の2段階設計をRAGや文書QAパイプラインに組み込む設計思想は、今後のシステム構築の参考になる。自社の文書処理ワークフローでVLMを検討している企業は、表の解像度管理をアーキテクチャ設計の早期段階から考慮することが望ましい。

背景・経緯

VLMによる文書理解では、表をテキストに変換する方法と画像のまま渡す方法が競合している。画像渡し(光学的コンテキスト圧縮)はパース不要で汎用性が高い一方、解像度を下げるとモデルの推論品質が劣化するトレードオフが課題だった。本論文はこの課題に対し、解像度の役割を「関連性判定」と「詳細推論」に分割することで打開を試みている。