塔斯娱乐资讯网

DeepMind 本月给最新 Gemini 模型加了 agentic video understanding:模型不再逐帧被动处理视频,而是像 agent 一样去浏览、查询、推理视频内容。 强调"更低 token 用量",意味着视频分析的成本结构可能被改写——监控、内容审核、医学影像、自动驾驶都吃 token。 谁先把视频理解做成低成本可调用的 ​

DeepMind 本月给最新 Gemini 模型加了 agentic video understanding:模型不再逐帧被动处理视频,而是像 agent 一样去浏览、查询、推理视频内容。

强调"更低 token 用量",意味着视频分析的成本结构可能被改写——监控、内容审核、医学影像、自动驾驶都吃 token。

谁先把视频理解做成低成本可调用的能力,谁就多一张多模态牌。