Google DeepMindは、Geminiの最新モデルに「エージェント型動画理解」を導入した。Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Liteで利用でき、長尺動画を固定フレームで機械的に読むのではなく、目的に応じて必要な場面を探して分析する。
固定FPSから、目的に応じて探す方式へ
従来の動画分析では、モデルが一定のフレームレートで映像を取り込み、動画全体を広く処理する方式が一般的だった。Googleの説明では、新機能はGeminiの推論とネイティブ動画ツールを組み合わせ、映像フレーム、音声、文字起こしの中から必要な箇所を動的に探索する。これにより、トークン消費を最大88%、分析コストを最大66%削減し、品質を最大7%高めるとしている。
指標 | Googleの説明 |
|---|---|
対象モデル | Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Lite |
トークン消費 | 最大88%削減 |
コスト | 最大66%削減 |
品質 | 最大7%向上 |
ユースケースは業務動画に広い
長時間の研修動画、会議録画、監視映像、製造ライン映像、スポーツやエンタメの素材管理では、必要な瞬間だけを高精度に探す能力が重要になる。Googleは、サブ秒単位の瞬間検索、異常検知、反復動作や物体のカウント、長尺動画からの情報検索を例に挙げている。
日本企業への示唆
動画データは多くの企業に蓄積されているが、検索や分析のコストが高く、活用が進みにくかった。エージェント型の動画理解が実用化すれば、教育、品質管理、防犯、店舗オペレーションの改善に使いやすくなる。一方で、人物映像や音声を扱う場合は、同意、保管期間、アクセス権限、目的外利用の制限を明確にする必要がある。
参考: Google DeepMind


.png&w=384&q=75)

