DeepMind 本月给最新 Gemini 模型加了 agentic video understanding:模型不再逐帧被动处理视频,而是像 agent 一样去浏览、查询、推理视频内容。
强调"更低 token 用量",意味着视频分析的成本结构可能被改写——监控、内容审核、医学影像、自动驾驶都吃 token。
谁先把视频理解做成低成本可调用的能力,谁就多一张多模态牌。

DeepMind 本月给最新 Gemini 模型加了 agentic video understanding:模型不再逐帧被动处理视频,而是像 agent 一样去浏览、查询、推理视频内容。
强调"更低 token 用量",意味着视频分析的成本结构可能被改写——监控、内容审核、医学影像、自动驾驶都吃 token。
谁先把视频理解做成低成本可调用的能力,谁就多一张多模态牌。
