公開:2026年9月4日, 最終更新:2026年9月4日
30秒サマリー
- HcompanyがApache 2.0ライセンスで260M・800MパラメータのマルチモーダルエンコーダNeoMMEを公開
- 既存モデル比で最大255倍のインデックス圧縮と約2倍のエンコード速度を実現し、視覚的RAGのコスト削減に直結
- 単一Transformerでテキストと画像を同時処理する設計で、OCR前処理不要のドキュメント検索が可能
何が起きたか
フランスのAIスタートアップHcompanyは2026年9月3日、マルチモーダルエンコーダ「NeoMME」をHugging Face公式ブログで詳説し、モデルをApache 2.0ライセンスのもとHugging Face Transformersで公開した。NeoMMEは260Mと800Mの2サイズで提供され、テキストトークンと画像パッチを単一の双方向Transformerで処理する設計が特徴。既存の多くの視覚的文書検索モデルが採用する「独立した視覚エンコーダ+因果的言語モデル」の組み合わせを用いず、モデル全体をマスクト離散拡散の目的関数でスクラッチから学習している。
検索ファインチューニング版「NeoMME-Retriever」は、ColPaliが導入したページ画像アプローチを採用し、PDFからのOCR前処理を経ずに文書ページのスクリーンショットをそのまま検索対象とする。1回の推論でデンス埋め込みとレイト・インタラクション埋め込みの両方を返す二頭設計を備える。視覚的文書検索ベンチマーク「ViDoRe v3」のnDCG@10において、260Mモデルは300M未満のモデル中最高スコア0.523を記録。パラメータ数がColQwen2.5(3.75B)の約14分の1でありながら、スコア差は0.002にとどまると同ブログは説明している。
インデックスの保存容量については、階層的トークンプーリングと非対称量子化を組み合わせることで、レイト・インタラクションインデックスのストレージを1ページあたり約1.5MBから6kBへ(255分の1)削減でき、ベースラインのnDCG@10の95%以上を維持するとしている。エンコード速度はNVIDIA L40S GPU上で2048×2048の入力サイズにて約51ページ/秒を達成し、同ブログによれば同条件でColModernVBERTの約2倍のスループットという。
原典ハイライト
「NeoMMEは単一の双方向TransformerでテキストとRAW画像パッチを処理し、視覚エンコーダも因果的デコーダも持たない。ViDoRe v3においてモデルサイズとnDCG@10のパレートフロンティア上に位置し、255倍のインデックス圧縮を実現しつつ検索精度の95%以上を維持する」(Hcompany公式ブログより要約)
出典: Hugging Face Blog(公式ブログ)
So What?(なぜ重要か)
視覚的RAG(検索拡張生成)の実運用における2大障壁——大量ドキュメントのインデックス構築コストと、ベクトルDB上でのストレージコスト——に対し、NeoMMEは単一モデルで同時に解決策を提示している。OCR前処理が不要なため、PDFや図表・表が多い日本語社内文書の検索パイプライン構築を大幅に簡素化できる可能性がある。Apache 2.0ライセンスでの公開により商用利用も選択肢に入る。
日本企業への示唆
社内文書検索・契約書検索・マニュアル検索などの視覚的RAG導入を検討している日本企業にとって、NeoMMEは選定候補として検証する価値がある。特に①ストレージコストが課題の大規模コーパス運用、②レイアウトや図表を含む文書の検索精度改善、③GPUコスト削減を優先する場面で有効とみられる。260Mモデルであれば小規模なGPUサーバーでも高スループットが見込め、PoC段階のコストを抑えながら精度を確認できる。一方、多言語対応を謳っているものの日本語の実際の検索精度については原文中に具体的な言及がなく、実環境での検証が不可欠である。
背景・経緯
視覚的文書検索の分野では、ColPali(ページ画像をそのまま検索対象とするアプローチ)が注目を集めており、ColBERT流のレイト・インタラクション手法と組み合わせたモデルが複数登場している。NeoMMEはModernBERTやModernVBERTの流れを踏まえつつ、独立した視覚エンコーダへの依存を排除することで効率化を図った新設計として位置づけられている。Hcompanyは技術レポートとVisual RAGデモも同時公開している。







