公開:2026年9月2日, 最終更新:2026年9月2日
30秒サマリー
- Google DeepMindがGemini 3.7 Flash等向けに「エージェント型動画理解」機能を提供開始
- 静的処理と比べトークン消費を最大88%削減、コストを最大66%削減、精度を最大7%向上
- Gemini APIで追加料金なく利用可能。YouTubeの「Ask YouTube」機能にも今後展開予定
何が起きたか
Google DeepMindは2026年9月1日付の公式ブログで、「エージェント型動画理解(Agentic Video Understanding)」機能をGemini 3.7 Flash、3.6 Flash、3.5 Flash-Liteの3モデルで提供開始したと発表した。同機能はGoogle AI StudioおよびGemini Enterprise Agent Platformを通じたGemini APIで利用でき、動画アップロードとYouTube動画の両方に対応する。
従来の静的処理ではモデルが固定フレームレート(デフォルト1FPS)で動画全体を取り込む仕様だったが、エージェント型動画理解では「何を・どのタイミングで・どのモダリティ(映像フレーム、音声、字幕)で取得するか」をモデル自身がエージェントループを通じて判断し、必要な箇所のみを動的にフェッチする。標準的な動画解析ベンチマークにおいて、トークン消費量を最大88%削減、分析コストを最大66%削減、精度を最大7%向上できるとしている。
ユースケースとして、サブ秒精度のシーン検索(1FPSでは見逃しやすい瞬間の変化を特定)、数時間にわたる長尺動画からの複雑クエリへの回答、異常検知、動作・物体カウントなどが挙げられている。特に10分のハウツー動画から90分の講義、数時間の録画まで、長尺コンテンツで効果が顕著とされる。なお同機能は標準のGemini APIトークン料金で利用でき、追加費用は発生しない。
今後の展開としては、GeminiアプリのFlash・Flash-Liteモデル全ユーザーへのロールアウトと、YouTubeの動画視聴ページにおける「Ask YouTube」機能への組み込みが予定されていると原文は述べている。
原典ハイライト
標準ベンチマークでトークン消費最大88%削減・コスト最大66%削減・精度最大7%向上を達成。Gemini 3.7 Flashがコスト対精度の「パレートフロンティア」にあると同社は説明している。APIの設定を「agentic」に変えるだけで有効化でき、追加料金は不要。
出典: Google DeepMind Blog(公式ブログ)
So What?(なぜ重要か)
動画AIの最大のボトルネックだった長尺コンテンツのトークンコストが構造的に下がる転換点となりうる。開発者が従来手動で実装していた「必要箇所だけ抽出する」ロジックをモデルが自律的に担うことで、動画解析パイプラインの開発工数も削減できる可能性がある。
日本企業への示唆
製造業の品質検査映像・監視カメラ映像、メディア企業の動画アーカイブ検索、研修・会議録画の要約など、日本企業が検討しやすい動画AI活用領域でコスト試算が大きく変わりうる。特に長時間動画を対象とする業務での概念実証(PoC)コストが下がるため、これまでコスト面で二の足を踏んでいたプロジェクトを再評価する機会になる。API変更は設定値1行で済むとされており、既存のGemini API連携があれば即時に試験導入が可能な点も見逃せない。
背景・経緯
Google DeepMindはすでに画像理解において「エージェント型ビジョン(Agentic Vision)」としてコード実行とネイティブ画像理解を組み合わせた機能を提供しており、今回の動画向け機能はその動画版と位置づけられている。原文では今回の機能が「新機能」として提供開始されたことが明記されており、以前から存在していたサービスの解説記事ではない。




