Google DeepMindは2026年9月1日、Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Liteの全モデルに「エージェント型動画理解」機能を提供開始したと発表しました。従来のように動画を固定フレームレートで機械的に処理するのではなく、Geminiが映像・音声・書き起こしのモダリティを横断し、対象のセグメントを自ら動的に検索・スキャン・詳細確認する仕組みです。

効果はトークン消費が最大88%削減、解析コストが最大66%削減、精度は最大7%向上とされています。動画編集向けのサブ秒単位の瞬間検索、数時間規模の長尺動画解析、可変フレームレートによる異常検知、アクション・物体の正確なカウントといった用途が想定されています。

現在はGoogle AI Studio、Gemini Enterprise Agent Platform、Geminiアプリ(全ユーザーへ展開中)で利用でき、YouTubeの「Ask YouTube」機能にも近日提供される予定です。

出典が伝えている要点

  • Googleは2026年9月1日、Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Liteモデル全体でエージェント型動画理解機能を提供開始した。
  • この機能によりトークン消費が最大88%削減される。
  • この機能により動画解析コストが最大66%削減される。
  • この機能により精度(quality)が最大7%向上する。
  • 従来は動画を固定フレームレートで処理していたが、この技術によりGeminiは対象の動画セグメントを動的に検索・スキャン・詳細確認できるようになった。
  • Geminiは視覚フレーム、音声、書き起こしのモダリティを横断して、何を、どの速度で、どのモダリティで見るかを判断する。
  • 主な用途として、動画編集向けのサブ秒単位の瞬間検索が挙げられている。
  • 主な用途として、数時間規模の長尺動画コンテンツの解析が挙げられている。
  • 主な用途として、可変フレームレートによる異常検知の精度向上が挙げられている。
  • 主な用途として、アクションや物体の正確なカウントが挙げられている。
  • この機能はGoogle AI Studio、Gemini Enterprise Agent Platform、Geminiアプリ(全ユーザーへ展開中)で利用可能である。
  • YouTubeの「Ask YouTube」機能でもこの機能が近日提供予定である。

原文より

dynamically search, scan, and inspect target video segments

出典: deepmind.google

← 2026.09.02 の号を通しで読む