AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

Google DeepMind、エッジ向けマルチモーダル埋め込みモデル「EmbeddingGemma 2」を公開

30秒サマリー

  • テキスト・画像・音声・動画を単一モデルで統合処理するオンデバイス埋め込みモデルをApache 2.0ライセンスで提供開始
  • 7億4000万パラメータながらPixel 11 ProでRAM約567MBで動作し、プライバシー重視のオフラインRAGを実現
  • 前世代EmbeddingGemmaは2000万超ダウンロードを記録しており、開発者コミュニティからの需要が今回の拡張につながった

何が起きたか

Google DeepMindは2026年10月6日、マルチモーダル埋め込みモデル「EmbeddingGemma 2」の提供を開始したと公式ブログで発表した。Gemma 4アーキテクチャをベースに構築された同モデルは7億4000万パラメータで、テキスト・コード・画像・動画・音声を単一の埋め込み空間に統合的にマッピングする。Apache 2.0ライセンスで商用利用が可能で、HuggingFaceおよびKaggleでモデルウェイトを公開している。

性能面では、テキスト専用利用時にパラメータ数を最小2億7000万に絞れるモジュール設計を採用。Matryoshka Representation Learning(MRL)により出力ベクトルを768次元から最大128次元まで動的に圧縮でき、ローカルベクトルDBのストレージを最大6分の1に削減できるとしている。量子化適用時にGoogle Pixel 11 Proでテキスト専用では約191MB、フルマルチモーダルでは約567MBのアクティブRAMで動作することを確認している。

コンテキストウィンドウは8Kトークンで、前世代の4倍に拡大。音声5.5分、画像29枚、動画フレーム58枚、またはこれらの組み合わせをローカルで直接処理できる。MTEB Codeベンチマークではスコアが68.76から78.68へと9.92ポイント向上し、コードベースのローカルインデックスや意味的コード検索への活用が想定されている。

同社は前世代のEmbeddingGemmaが2000万超ダウンロードを達成したと述べており、今回の発表はその実績を踏まえた拡張版として位置づけられている。Gemma 4と同じテキストトークナイザー・音声エンコーダーを共有するため、両モデルを組み合わせたオンデバイスRAGパイプラインを低い合計メモリフットプリントで構築できるとしている。

原典ハイライト

「EmbeddingGemma 2はサブ1Bのマルチモーダル埋め込みモデルの中でサイズあたり最高水準の性能を達成し、自身の2倍以上のサイズを持つ専門モデルを上回るケースもある」とブログは記述。オンデバイスRAGにおけるデータプライバシー確保・レイテンシ削減・完全オフライン動作の実現を主要な価値として強調している。

出典: Google DeepMind Blog(公式ブログ)

So What?(なぜ重要か)

クラウドAPIを経由せずにデバイス上でマルチモーダルな意味検索やRAGが完結できるモデルが商用利用可能な形で公開されたことは、データを外部送信できない業務・産業領域でのAI活用の選択肢を具体的に広げる。音声・動画・テキストを横断した検索を単一モデルで処理できる点は、従来は複数モデルの組み合わせが必要だったパイプラインの簡素化につながるとみられる。

日本企業への示唆

医療・法務・製造など機密情報を扱う日本企業にとって、クラウド送信なしにドキュメント・音声・映像を横断検索するRAGシステムをモバイルやエッジデバイス上で構築できる現実的な選択肢となる。Apache 2.0ライセンスで商用利用可能なため、自社製品への組み込みや顧客向けアプリ開発においてライセンスコストを抑えつつ検証を始められる。まずGoogle AI Edge Galleryで提供されているデモ(Instant Media SearchやVideo Moments Finder)で実運用イメージを確認し、HuggingFaceからウェイトをダウンロードしてPoC環境を構築することが現実的な最初のステップとなるだろう。

背景・経緯

前世代のEmbeddingGemmaはテキスト専用の軽量埋め込みモデルとして公開され、2000万超ダウンロードを記録した。今回のEmbeddingGemma 2はその後継として、対応モダリティをコード・画像・動画・音声に拡張し、ベースアーキテクチャもGemma 4に更新した。ブログによれば、GeminiのEmbeddingモデルと同じ技術基盤から構築されているとしている。