AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

Google DeepMind、会話AIにリアルタイム映像アバターを統合した「Gemini 3.8 Live with Live Avatar」をGemini Enterpriseで提供開始

30秒サマリー

  • GoogleのDeepMindが、音声対話AIにリアルタイム映像生成アバター機能を組み合わせた「Gemini 3.8 Live with Live Avatar」をGemini Enterpriseで提供開始した
  • 97言語対応のリップシンク・表情生成、バックグラウンドでのツール呼び出し継続など、エンタープライズ向けの顧客対応自動化に特化した機能群を備える
  • カスタムアバター生成やSynthIDによるウォーターマーク付与など、ブランド対応と安全性担保の仕組みも組み込まれている

何が起きたか

Google DeepMindは2026年9月24日、音声対話モデル「Gemini 3.8 Live」に映像アバター機能を統合した「Gemini 3.8 Live with Live Avatar」をGemini Enterpriseで提供開始したと公式ブログで発表した。同ブログによれば、同機能は先週発表されたGemini 3.8 Liveの公開を受けて開発されたものという。

Live Avatar機能は、ニアリアルタイムの映像生成と音声を組み合わせ、精緻なリップシンク・自然な表情・スムーズな会話ターンテイクを実現する。視覚・音声の入力を同時処理して応答を生成するマルチモーダル設計で、顧客サービスや対話型ガイダンスといったユースケースを想定している。

技術面では「非同期ツール呼び出し」に対応しており、対話を途切れさせることなくバックグラウンドでデータ取得や処理を実行できる。ブログではホテルのチェックイン対応を例示として示している。また97言語でリップシンクと表情を動的に適応させる多言語音声変換をネイティブサポートしており、言語切り替え時も映像品質の劣化や視覚的なズレが生じないとしている。

ブランドカスタマイズについては、プリセットアバターライブラリに加え、高品質な参照画像から独自アバターを生成する機能を提供する。ただしカスタムアバター作成は現時点でエンタープライズの審査制(アローリスト)のみの対応となっている。安全性への配慮として、すべての音声・映像出力にSynthIDの透かしが不可視の形で埋め込まれ、AIが生成したコンテンツであることを検証可能にしているという。

原典ハイライト

「Live Avatarは、音声と映像の入力を同時処理し、表情豊かな音声と映像で応答することで、より自然な会話を実現する。非同期ツール呼び出しにより、対話を継続しながらバックグラウンドでツール処理やデータ取得が可能」(Google DeepMind公式ブログより要約)

出典: Google DeepMind Blog(公式ブログ)

So What?(なぜ重要か)

テキストチャットボットや音声AIに次ぐ「映像アバターAIエージェント」が、エンタープライズ向け製品として実用段階に入ったことを示す。顧客接点においてAIが「顔を持つ」ことで、コールセンター・受付・オンボーディングなどの自動化領域が大幅に広がる可能性がある。97言語対応とブランドカスタマイズ機能は、グローバル展開する企業が自社ブランドに沿ったAI接客を標準化しやすくする設計となっており、企業のAI導入判断を加速させるとみられる。

日本企業への示唆

顧客対応のAI自動化を検討している日本企業にとっては、チャットボットや音声BOTの次のステップとして映像アバターエージェントを視野に入れる必要が出てくる。Gemini Enterpriseを通じたAPI提供であるため、既存のGoogleクラウド契約があれば統合検討のハードルは相対的に低い。カスタムアバターはアローリスト制のため、導入には事前のGoogle側との調整が必要な点に注意が必要。また全出力にSynthIDが付与される設計は、AI生成コンテンツの透明性開示を義務付ける規制議論が進む中で、コンプライアンス面でも参考にすべき設計思想といえる。

背景・経緯

原文によれば、Gemini 3.8 Liveは発表の1週間前(2026年9月中旬)に公開されており、Live Avatar機能はその直後の拡張として位置づけられている。サービスはGemini Enterprise経由で提供され、APIドキュメントも公開されているとのこと。開発はGemini Audio Teamが中心となって行ったと記載されている。