Google、Geminiにエージェント型動画理解を導入──長尺動画分析のコストを最大66%削減

Google、Geminiにエージェント型動画理解を導入──長尺動画分析のコストを最大66%削減

Google DeepMindは、Geminiの最新モデルに「エージェント型動画理解」を導入した。Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Liteで利用でき、長尺動画を固定フレームで機械的に読むのではなく、目的に応じて必要な場面を探して分析する。

固定FPSから、目的に応じて探す方式へ

従来の動画分析では、モデルが一定のフレームレートで映像を取り込み、動画全体を広く処理する方式が一般的だった。Googleの説明では、新機能はGeminiの推論とネイティブ動画ツールを組み合わせ、映像フレーム、音声、文字起こしの中から必要な箇所を動的に探索する。これにより、トークン消費を最大88%、分析コストを最大66%削減し、品質を最大7%高めるとしている。

指標

Googleの説明

対象モデル

Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Lite

トークン消費

最大88%削減

コスト

最大66%削減

品質

最大7%向上

ユースケースは業務動画に広い

長時間の研修動画、会議録画、監視映像、製造ライン映像、スポーツやエンタメの素材管理では、必要な瞬間だけを高精度に探す能力が重要になる。Googleは、サブ秒単位の瞬間検索、異常検知、反復動作や物体のカウント、長尺動画からの情報検索を例に挙げている。

日本企業への示唆

動画データは多くの企業に蓄積されているが、検索や分析のコストが高く、活用が進みにくかった。エージェント型の動画理解が実用化すれば、教育、品質管理、防犯、店舗オペレーションの改善に使いやすくなる。一方で、人物映像や音声を扱う場合は、同意、保管期間、アクセス権限、目的外利用の制限を明確にする必要がある。

参考: Google DeepMind

この記事に携わった人
Mynto編集部
Mynto.aiの編集部です。
関連記事
お問い合わせ各種

課題解決のためのお役立ち資料ダウンロードや、
サービスのお問い合わせが可能です。
お気軽にご相談ください。