AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

Google DeepMind、表現力特化の音声生成モデル「Gemini 3.8 TTS」を提供開始

公開:2026年9月24日, 最終更新:2026年9月24日

30秒サマリー

  • Google DeepMindが新テキスト音声変換モデル「Gemini 3.8 Flash TTS」と「Flash-Lite TTS」の提供を2026年9月23日に開始した
  • 100以上の言語・方言に対応し、自然言語プロンプトだけでゼロからキャラクターボイスを設計・複製できる
  • SynthIDによる透かし技術と同意確認機能を内蔵し、音声の悪用防止と権利保護を両立している

何が起きたか

Google DeepMindは2026年9月23日、テキスト音声変換(TTS)モデル「Gemini 3.8 Flash TTS」および「Gemini 3.8 Flash-Lite TTS」の提供を開始したと公式ブログで発表した。両モデルはそれぞれ異なる用途を想定しており、Flash TTSはゲームや没入型オーディオブック、ポッドキャストなど高い表現力が求められるクリエイティブ制作向け、Flash-Lite TTSは大量の吹き替えや音声エージェントなど高ボリューム・コスト効率重視の用途向けに最適化されている。

主な機能として、自然言語プロンプトによるゼロからの声質設計(役割・アクセント・声の特徴を指定可能)、2,000以上の既成ボイスライブラリ、30秒の音声サンプルから声を複製するボイスレプリケーション、1スクリプトからの2話者シーン演出、「<laughs>」「<sigh>」といった非言語音声の挿入などが提供される。

評価面では、Hume AIのVoice Design Benchmarkで総合1位(71.4点)、音声品質インデックスでも同1位・2位を獲得したとされる。また、Voice ArenaによるブラインドのユーザーテストでGemini 3.8 Flash・Flash-Lite TTSは日本語、ブラジルポルトガル語、ベトナム語、アラビア語(MSA)、メキシコスペイン語、ヒンディー語などの主要言語で上位に位置したと原文は述べている。

提供チャンネルは、開発者向けにGemini APIおよびGoogle AI Studio(本日より展開)、全ユーザー向けにGemini Notebook(Flash TTS)およびGoogle Vids(Flash-Lite TTS)で順次利用可能。企業向けGemini EnterpriseへのAPI提供は近日中としている。Figma、HeyGen、Agora、Vercelなどのパートナー企業が統合を進めていることも明かされた。

原典ハイライト

原文では「音声生成を静的なプリセットから動的なクリエイティブスタジオへ変革する」と位置づけており、30秒の音声サンプルから声を複製する際には声の所有者による口頭同意録音と一致確認を必須とする同意検証プロセスを採用している点が特記されている。また、生成された全音声にSynthIDの不可視透かしを埋め込み、AIが生成した音声として検出可能にすることでフェイク音声による誤情報拡散を抑止するとしている。

出典: Google DeepMind Blog(公式ブログ)

So What?(なぜ重要か)

音声生成AIがプリセット選択から「自然言語で声を設計する」フェーズへ移行しつつあることを示す。100言語以上への対応と2,000超の既成ボイス、さらにゼロ設計・複製・長尺生成を組み合わせることで、多言語コンテンツや音声エージェントの制作コストが大幅に下がる可能性がある。一方、声の複製機能が普及すれば声優・ナレーター等の声の権利管理が業界課題として浮上することも想定される。

日本企業への示唆

カスタマーサポートに音声AIエージェントを導入する企業は、Flash-Lite TTSのような高スループット・低コストモデルを活用することで多言語対応コールセンターのコスト構造を見直せる可能性がある。コンテンツ制作(オーディオブック・企業研修動画・広告ナレーション)では、ブランド統一感のある「自社専用ボイス」をゼロから設計・保存・再利用できる点が差別化要因になりうる。ただし、声の複製機能は使用許諾・同意確認のガバナンス整備が前提となるため、法務・契約部門を交えたポリシー策定を早期に進めることが重要。Figma・HeyGenなど既存ワークフローツールとの統合が進んでいるため、現在利用中のデザイン・映像制作ツールにTTS機能が自然に組み込まれるシナリオにも備えたい。

背景・経緯

原文によれば、Gemini 3.8 Flash TTSとFlash-Lite TTSは、3.5 Live Translate、3.5 Transcribe、3.8 Live、3.8 Live Extended Thinkingに続く「Gemini Audioファミリー」の最新モデルとして位置づけられている。従来は30種類の既成ボイスから選ぶ形式だったと原文は示唆しており、今回の発表でその上限が実質的に撤廃されたとされる。