AIモデル・生成AIの選び方

Geminiのエージェント動画理解とは?長い動画を調べる4手順

公開日 ・更新日

長い動画をAIに読ませる仕事では、全部を同じ間隔で処理すればよいとは限りません。必要な場面を探し、映像、音声、文字起こしを使い分けるほうが、調査の設計を組みやすくなります。

Google公式ブログは2026年9月1日、「Introducing agentic video understanding with Gemini」を公開しました。Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Liteに、動画を動的に検索・走査・確認するエージェント動画理解を導入します。動画アップロードとYouTube動画を、Gemini APIのGoogle AI StudioとGemini Enterprise Agent Platformから利用できます。

知りたい場面と答えの形を決める

「重要な場面を3つ」「異常が起きた時刻」「同じ動作の回数」のように、質問と出力を具体化します。長い動画を丸ごと要約する前に、時刻、対象、判断に使う根拠を決めると、結果を確認しやすくなります。

agentic処理を一件で試す

Googleの例では、API設定で処理方法を`agentic`に指定します。まず一つの動画、一つの質問で実行し、どの区間を見たか、映像・音声・文字起こしのどれを使ったかを記録します。

静的処理と確認コストを比べる

Googleの標準ベンチマークでは、トークン消費を最大88%、コストを最大66%削減し、精度を最大7%高めたと報告しています。これはベンチマークの結果です。自社の動画でも同じ数字になると決めつけず、同じ質問を別の処理方法で試し、トークン、時間、見落としを比べます。

時刻と根拠を人が確認する

編集候補、研修記録、点検映像など、見落としが仕事へ影響する用途では、AIが示した時刻へ人が戻って映像を確認します。採用した回答、修正した箇所、確認者を残せば、後から同じ動画を見直せます。

エージェント動画理解は、動画を最初から最後まで均一に読む機能ではありません。目的に合わせて必要な場面を探すための仕組みです。あなたの会社でも、まず一件の動画と一つの質問から始める。公式ベンチマークと自社の確認コストを分けて見れば、使いどころが見えてきます。

出典(公式):Google「Introducing agentic video understanding with Gemini」 https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-agentic-video-in-gemini/

Geminiで動画や会議記録を業務へつなぎ、確認手順と費用まで整理したい方は、COZITOへご相談ください。

出典・参考資料

著者: 松井 勇樹