公開:2026年9月11日, 最終更新:2026年9月11日
30秒サマリー
- AWSがTwelveLabs Marengo Embed 3.0をAmazon Bedrock Knowledge Basesの埋め込みモデルとして一般提供(GA)開始した
- 動画・音声・画像・テキストをマルチモーダルに512次元ベクトル化し、複雑なパイプライン構築不要で自然言語検索が実現できる
- スポーツ分析・メディア管理・セキュリティ・教育・小売など大量映像資産を活用する業種での活用が想定される
何が起きたか
AWSは、TwelveLabs Marengo Embed 3.0をAmazon Bedrock Knowledge Basesの埋め込みモデルとして一般提供(GA)開始したと公式ブログで発表した。具体的な発表日付は原文には明記されていない。Marengo Embed 3.0は動画・音声・画像・テキストを512次元のベクトル空間に統合的にエンコードするマルチモーダル埋め込みモデルであり、Managed Knowledge Bases(Managed MKB)と組み合わせることで、フレーム抽出・音声トランスクリプション・埋め込み生成・ベクトルインデックスへの書き込みを自動処理する。
ユーザーはAmazon S3に動画ファイル(MP4、MOV)や画像(JPEG、PNG)をアップロードし、Amazon Bedrockコンソール上でマネージドKBを作成してSyncを実行するだけで、前処理なしに自然言語クエリによる意味検索が利用できる。検索結果にはチャンク開始・終了時刻やソースURIなどのメタデータが含まれ、該当シーンの特定が可能となる。公式ブログでは2022 FIFAワールドカップ決勝の10分間クリップに対し「このサッカーの試合からPKシーンを見せて」というクエリを実行するデモが示されている。
現時点での提供リージョンは米国東部(バージニア北部、us-east-1)および米国西部(北カリフォルニア、us-west-1)の2リージョンに限定される。料金は保存・取得量に応じた従量課金で、Marengo Embed 3.0の埋め込み生成にはAmazon Bedrock標準のモデル呼び出し料金が適用されると説明されている。
原典ハイライト
原文では「動画・メディア資産は意味での検索がほぼ不可能な状態にある」と問題提起し、従来は文字起こし・フレーム抽出・埋め込みモデル・ベクトルDBなどを組み合わせた複雑なパイプライン構築が必要だったと説明している。Marengo 3.0のGA提供により、これらが「Point your data source, sync, and search(データソースを指定し、同期し、検索する)」の3ステップに集約されると強調している。
出典: AWS Machine Learning Blog(公式ブログ)
So What?(なぜ重要か)
編集部の見方として、これまでエンタープライズ向け動画セマンティック検索は、多数のAWS・サードパーティサービスを自前で統合する高いエンジニアリングコストを要していた。今回のGA提供により、その複雑なパイプラインがAWSのマネージドサービスとして提供されることになり、動画資産の活用ハードルが大幅に下がると考えられる。RAGの対象がテキストから動画・音声・画像へと拡張される流れを象徴する動きであり、マルチモーダルRAGの実用化が加速するとみられる。
日本企業への示唆
編集部の分析として、スポーツ放送・セキュリティ監視・製造現場の品質管理動画・eラーニングコンテンツなど、大量の映像資産を保有する日本企業にとっては、これまで「見ているだけ」だった動画データを検索可能な業務資産に転換する具体的な選択肢が生まれた。現状は米国リージョンのみの提供であり、データレジデンシーの観点から国内リージョン対応を要する企業は提供拡大を待つ必要がある。まずはPoC段階で米国リージョンを活用し、ユースケースの有効性を検証しておくことが現実的な準備となる。料金体系が従量課金である点も、大規模展開前の小規模検証を試みやすい構造だ。
背景・経緯
Amazon Bedrock Knowledge Basesはテキスト中心のRAGサービスとして提供されてきたが、原文によれば動画・音声・画像ファイルへの対応も既に組み込まれており、今回のTwelveLabs Marengo Embed 3.0の一般提供開始によってマルチモーダルな意味検索が実用レベルで利用可能となった。TwelveLabs社はマルチモーダル動画理解に特化した企業であり、Amazon Bedrockのサードパーティモデル統合の一環として今回の連携が実現したとみられる。




