这几天办公室里聊AI的风向变了。以前大家问“用什么模型”,现在都换成了“能帮你干活吗”。从“有没有”到“好不好用”,这个转变值得让人琢磨。
刚好华尔街投行杰富瑞近日发了份报告,把八款主流中美AI Agent放到一起,用真实办公任务做了场实测打分。其中包括文件检索、联网研究、做PPT等任务,结果还挺有意思的。千问办公95分排至先,背后是所有产品里模型能力至强的Claude Cowork 94分排第二,OpenAI Codex 92分排第三。后面依次是Kimi Work 86分、豆包77分、MiniMax Code 71分,腾讯Workbuddy和谷歌Gemini Spark以66分垫底。
看到这个排名,让人好奇的,不是谁赢了,而是为什么赢。报告里把Agent能力拆成模型和Harness两部分。模型负责“思考”,Harness负责管指令、上下文、工具、边界、反馈、治理等。报告里做了个控制变量实验,去验证Harness的作用。即同一个模型,换不同的Harness,得分能差18个百分点以上。这意味着,很多时候我们觉得“AI不够聪明”,未必是模型本身不行,而是因为没人教它把聪明用对地方。
基于这个思路,杰富瑞还测算出各家产品的“Harness分”。结果是千问办公至高,甚至超过了美国的Claude Cowork和Codex。它在文档处理、多模态内容生成上的表现尤其突出。通俗讲就是,Harness的优势,可以很好弥补模型能力上的差距。同时,成本也是值得重视的点。对于企业来说,其关心的不只是Token的价格,更是完成一项真实任务要花多少钱。性能好、价格低,这个组合在商业化落地时竞争力很强。
顺着这个思路看,AI的竞争逻辑其实也正在变化。以前比“谁模型更强”,现在比“谁能把活干得更漂亮”。这中间差的一环恰好是Harness。即模型是基础,但基础之上的组织能力,才是决定体验的关键。而且Agent用久了,用户的历史任务、连接的工具都会融合进去。所以把Harness打磨好的产品,可能建立起比模型本身更难跨越的壁垒。
这份报告真正的价值,在于提醒我们,当一个行业走向“好不好用”时,衡量标准就从单一变成了多维。对于AI Agent来说,那个新增的维度,叫Harness。
#AIAgent#千问办公#Harness#AI测评#办公效率#大模型落地




