公開:2026年7月10日, 最終更新:2026年7月10日
30秒サマリー
- OpenAIが2026年7月8日、同時送受話が可能な新世代音声モデル「GPT-Live」をChatGPTユーザー向けに世界展開開始
- フルデュプレックス構造により会話を途切れなく継続しながら、バックグラウンドでGPT-5.5による検索・推論を並行実行
- API提供も近く予定しており、開発者・企業向けに事前登録フォームを公開中
何が起きたか
OpenAIは2026年7月8日、新世代の音声モデル「GPT-Live」を発表し、ChatGPTユーザーへのグローバル展開を開始した。GPT-Live-1とGPT-Live-1 miniの2バージョンが提供される。
最大の技術的特徴は「フルデュプレックス構造」の採用だ。従来のシステムが音声認識→言語モデル→音声合成と逐次処理するか、ユーザーの発話終了を待ってから応答する「ターン制」に制限されていたのに対し、GPT-Liveは入力処理と出力生成を同時並行で実行する。これにより「mhmm」「got it」といった相槌、割り込み発話への対応、思考中の間を待つ動作などが可能になり、人間同士の会話に近い体感が実現されるという。
また「デリゲーション(委任)」と呼ぶ仕組みにより、ウェブ検索や高度な推論が必要な質問に対してはバックグラウンドでGPT-5.5に処理を委託し、結果が揃い次第会話に自然に組み込む。推論深度はInstant・Medium・Highの3段階から選択できる。さらに天気・株価・スポーツ等のビジュアルカードをリアルタイム表示する機能も追加された。OpenAIによれば毎週1億5000万人以上がChatGPTの音声機能を利用しているという。
APIへの提供も近く実施予定で、開発者・企業向けに事前登録フォームが公開されている。安全対策として、出力中にリアルタイムで危険な内容を検知・修正できる仕組みも組み込まれており、詳細はシステムカードに公開されている。
原典ハイライト
原文では「フルデュプレックス構造によりモデルが毎秒複数回の相互作用判断(発話・傾聴・停止・割り込み・ツール呼び出し)を行える」と説明。内部評価では5〜10分の会話においてGPT-Live-1および同miniがAdvanced Voice Modeを全般的に上回り、専門科学推論(GPQA)・難易度の高いウェブ検索(BrowseComp)・テレコム向けマルチターン音声エージェント評価(τ³-Voice Telecom)でも優位性を示したとされる。
出典: OpenAI News/Research(公式ブログ)
So What?(なぜ重要か)
音声AIが「ターン制の制約」を突破したことで、電話応対・コールセンター・接客ガイダンスなど従来は「AIでは不自然」とされていたリアルタイム対話領域への実用化が一段と現実味を帯びる。バックグラウンド推論との組み合わせにより、音声インターフェースのまま複雑な問い合わせに対応できるエージェント型業務が視野に入る。
日本企業への示唆
コールセンター・カスタマーサポートを抱える日本企業にとって、GPT-LiveのAPI提供開始は直接的な検討機会となる。従来の音声ボットが苦手としていた「間の取り方」「割り込み対応」「複雑な照会への即答」が技術的に改善されており、顧客体験の向上と人的コスト削減を同時に狙える可能性がある。一方、API利用にあたっては自社データとの連携設計、音声データの取り扱い(個人情報保護法・セキュリティ)、および日本語での品質検証が先決課題となる。早期に事前登録フォームへアクセスし、パイロット検証の準備を進めることが競合優位確保につながるとみられる。
背景・経緯
ChatGPTの音声機能は、2023年のAdvanced Voice Mode(GPT-4o搭載)以来アップデートを重ねてきた。原文によれば初代ChatGPT Voiceは音声認識・LLM・音声合成の3モデルを直列接続するカスケード方式で、遅延と情報損失が課題だった。今回のGPT-Liveはその2世代後に当たり、アーキテクチャを根本から刷新したものと位置付けられている。



