動察 Beating AI 速報、Google が Gemini API に Agentic Video Understanding を導入。モデル自身がどの動画セグメントを見るか、どう確認するかを決定できる。通常モードではデフォルトで 1 FPS の固定フレーム抽出を行い、一度にコンテキストに入れる。新モードではタイムラインに沿ってセグメントを自律的に探し、質問に応じて映像、音声、または文字起こしテキストを選択する。高速な動きに遭遇した場合は、フレームレートを上げて再確認することも可能。
Google の自己テストによると、Gemini 3.7 Flash を有効にすると、トークン消費は最大 88% 削減、分析コストは最大 66% 削減、精度は相対的に最大約 7% 向上。1 秒未満の瞬間も特定でき、数時間の動画内の細部も検索可能。
技術的には、開発者が以前自分で構築する必要があった「まず位置を特定し、その後詳細を確認する」プロセスを Gemini 内部に組み込んだ。現在、Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Lite がすべて対応。アップロード動画と YouTube 動画の両方で利用可能で、追加の機能料金も発生しない。今後は Gemini App と YouTube の Ask YouTube にも統合される予定。