AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

vLLM-OmniをSageMaker AIに展開し、音声ストリーミングを実装する方法をAWSが公式解説

30秒サマリー

  • AWS公式ブログが、SageMaker AI上でリアルタイム音声合成を行う実装方法を全2回シリーズで解説
  • vLLM-Omni DLCとQwen3-TTSを組み合わせ、全文生成前に音声再生を開始できる双方向ストリーミングを実現
  • インスタンスプールやHTTP/2 WebSocket接続など、本番運用に向けた具体的な構成手順を公開

何が起きたか

AWSのMachine Learning Blogは、Amazon SageMaker AI上でリアルタイム音声アプリケーションを構築する方法を解説した記事を公開した。本記事はシリーズの第1回であり、AWS vLLM-Omni Deep Learning Container(DLC)を使ってQwen3-TTSモデルをデプロイし、テキストを入力として音声をストリーミング出力するまでの手順を詳説している。

vLLM-Omniはテキスト生成に特化した既存のvLLMを拡張し、テキスト・音声・画像・動画の複数モダリティを処理・生成できるランタイムである。AWS vLLM-Omni DLCはこのランタイムをAWSイメージとしてパッケージ化し、SageMaker AI向けのルーティングミドルウェアを追加したもので、SageMakerの双方向ストリーミング機能を通じてHTTP/2上のWebSocket接続で音声チャンクをリアルタイム転送できる。

具体的な構成では、クライアントがSageMaker Runtimeエンドポイント(ポート8443)に接続し、推論サイドカーがvLLM-Omniネイティブの`v1/audio/speech/stream`ルートへ接続を転送する。生成された音声は24kHz PCMチャンク形式で同一接続上を逆流し、Gradioアプリケーションが受信と同時に再生する仕組みだ。エンドポイントにはインスタンスプール機能を用い、ml.g6.xlarge・ml.g6e.xlarge・ml.g5.xlarge・ml.g4dn.xlargeをフォールバック順に設定できる。

本ブログは実際に動作するコードサンプルをGitHubで公開しており、デプロイスクリプト・共有ストリーミングトランスポート・Gradioクライアントが含まれている。なお、同シリーズの以前の記事ではVoxtral-Mini-4B Realtimeを用いた音声認識(STT)側の実装が示されており、今回の記事はその出力側に相当する。第2回では同DLCファミリーを使った画像・動画生成を扱う予定とされている。

原典ハイライト

「モデルが全文生成を完了する前に音声の再生を開始できる」双方向ストリーミングの実現が本解説の核心。SageMaker AI上でvLLM-Omni DLCを使い、HTTP/2 WebSocket経由で1本の持続的接続を確立し、テキスト送信と音声受信を同時に行うアーキテクチャを示している。

出典: AWS Machine Learning Blog(公式ブログ)

So What?(なぜ重要か)

音声エージェントや顧客対応AIにおける最大の課題の一つは「応答までの沈黙」だが、ストリーミングTTSにより全文生成を待たずに音声出力を開始できる。AWSがDLCとして標準的なデプロイ手順を整備したことで、このような低レイテンシ音声パイプラインを独自に実装・管理するコストが下がる。さらに同一DLCファミリーがASR・画像・動画生成も対象とするため、マルチモーダルAI基盤を単一のランタイム体系で統合できる可能性がある。

日本企業への示唆

コールセンターの自動応答、音声UIを持つ業務アプリ、アクセシビリティツールを検討している日本企業にとって、本解説は即実装に使えるリファレンス構成となる。SageMakerのマネージドインフラとインスタンスプールを活用することで、GPU容量不足のリスクをある程度緩和しながら本番環境へ展開できる。ただし、STT側(Voxtralなど)との接続オーケストレーションは本記事の対象外であり、エンドツーエンドの音声パイプライン構築には別途設計が必要な点に留意したい。また、実行中のGPUエンドポイントは時間課金が続くため、開発・評価後の即時削除など運用コスト管理のルール整備も欠かせない。

背景・経緯

AWSはvLLMやSGLangなど広く採用されているサービングフレームワーク向けにDLCを提供しており、今回のvLLM-Omniはその専門特化型DLCシリーズの一環として位置付けられている。SageMaker AIの双方向ストリーミング機能はHTTP/2ベースのWebSocketをサポートしており、リアルタイム性が求められるユースケース向けの基盤として活用されている。本記事は音声合成(TTS)側の実装を扱うPart 1であり、Part 2では同DLCを画像・動画生成に応用する予定。