Google DeepMindは2026年9月1日、Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Liteの全モデルに「エージェント型動画理解」機能を提供開始したと発表しました。従来のように動画を固定フレームレートで機械的に処理するのではなく、Geminiが映像・音声・書き起こしのモダリティを横断し、対象のセグメントを自ら動的に検索・スキャン・詳細確認する仕組みです。
効果はトークン消費が最大88%削減、解析コストが最大66%削減、精度は最大7%向上とされています。動画編集向けのサブ秒単位の瞬間検索、数時間規模の長尺動画解析、可変フレームレートによる異常検知、アクション・物体の正確なカウントといった用途が想定されています。
現在はGoogle AI Studio、Gemini Enterprise Agent Platform、Geminiアプリ(全ユーザーへ展開中)で利用でき、YouTubeの「Ask YouTube」機能にも近日提供される予定です。
出典が伝えている要点
- Googleは2026年9月1日、Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Liteモデル全体でエージェント型動画理解機能を提供開始した。
- この機能によりトークン消費が最大88%削減される。
- この機能により動画解析コストが最大66%削減される。
- この機能により精度(quality)が最大7%向上する。
- 従来は動画を固定フレームレートで処理していたが、この技術によりGeminiは対象の動画セグメントを動的に検索・スキャン・詳細確認できるようになった。
- Geminiは視覚フレーム、音声、書き起こしのモダリティを横断して、何を、どの速度で、どのモダリティで見るかを判断する。
- 主な用途として、動画編集向けのサブ秒単位の瞬間検索が挙げられている。
- 主な用途として、数時間規模の長尺動画コンテンツの解析が挙げられている。
- 主な用途として、可変フレームレートによる異常検知の精度向上が挙げられている。
- 主な用途として、アクションや物体の正確なカウントが挙げられている。
- この機能はGoogle AI Studio、Gemini Enterprise Agent Platform、Geminiアプリ(全ユーザーへ展開中)で利用可能である。
- YouTubeの「Ask YouTube」機能でもこの機能が近日提供予定である。
原文より
dynamically search, scan, and inspect target video segments
出典: deepmind.google