30秒サマリー
- GoogleがリアルタイムAI音声対話モデル2種をGemini APIや各種サービスで提供開始
- 複雑タスクの並行推論・97言語の自動切替・視覚情報の即時処理が可能
- 企業向けエージェント・カスタマーサポート領域での活用を前面に打ち出す
何が起きたか
Google DeepMindは2026年9月15日付の公式ブログで、音声対話特化の新モデル「Gemini 3.8 Live」と「Gemini 3.8 Live Extended Thinking」の提供開始を発表した。両モデルはリアルタイムに近い推論を実現し、音声エージェント構築や日常の音声操作をより直感的にすることを目的として設計されている。
「Gemini 3.8 Live」はスケールとコスト効率を重視した設計で、会話中にバックグラウンドでAPIコールやツール実行を行いながら対話を継続できる。97言語の自動検出・切替、視覚入力のリアルタイム処理にも対応する。Speech Agent Arenaで2位の評価を得たとしている。「Gemini 3.8 Live Extended Thinking」は高複雑度タスク向けで、推論と発話を同時進行させながら「確認します…」のような自然な言語的手がかりで進捗を伝える。Artificial AnalysisのSpeech to Speech Quality Indexで82.6点・総合1位、τ-Voice(エージェントタスク完了率)68.6%などのベンチマーク結果を公開している。
提供チャネルについては、開発者向けにGemini APIとGoogle AI Studio、企業向けにGemini Enterprise(現在プライベートプレビュー)、一般ユーザー向けにGemini Liveアプリ・Search Live・Google Workspace(Docs・Gmail・Keep)での段階的展開が始まっているとしている。Salesforce、Genspark、Lumerisなどがパートナー企業として言及されており、AI生成音声にはSynthIDによる透かし処理が施されると説明している。
原典ハイライト
「Gemini 3.8 Live Extended ThinkingはArtificial AnalysisのSpeech to Speech Quality Indexで総合1位(82.6点)を獲得。τ-Voiceでは68.6%のエージェントタスク完了率を記録。すべての生成音声にはSynthIDの透かしが付与され、AI生成コンテンツの検出可能性を確保する」(Google DeepMind公式ブログより要約)
出典: Google DeepMind Blog(公式ブログ)
So What?(なぜ重要か)
音声AIが単なる応答から「バックグラウンドでツールを実行しながら対話を継続する」段階に移行しつつある。企業向けカスタマーサポート・社内エージェント領域では、従来のチャットボットやIVRに代わる実用レベルの選択肢として検討に値するフェーズに入ったと言える。97言語対応や視覚コンテキスト処理は多言語・グローバル対応業務の自動化にも直結する。
日本企業への示唆
コールセンターや社内ヘルプデスクを運営する企業は、Gemini Enterprise for Customer Experienceのプライベートプレビューへの参加を早期に検討する価値がある。特に複数言語対応が必要な企業(インバウンド観光・グローバル営業など)では97言語自動切替の実用性を評価すべきだ。LangChain・LangChain・LangChain・Vercelなど既存の開発フレームワークから利用可能なため、自社開発チームがいれば小規模なPoC(概念実証)から着手しやすい。一方、SynthID透かしの存在は規制対応の観点でもプラス材料となり、金融・医療など慎重な業種での導入検討を後押しする可能性がある。
背景・経緯
Googleは従来から「Gemini Live」として音声対話機能を提供しており、今回の3.8シリーズはその後継・強化版にあたるとみられる。音声エージェント向けのGemini Live APIには、Agora・LangChain・LiveKit・Pipecat・Vercelなどの開発者プラットフォームがすでに対応しており、エコシステムの拡大を並行して進めている状況だ。




