这两天,看到晚点LatePost发了一篇关于AI办公的深度报道,里面提到几个观点蛮有意思的。
刚好最近在给我们团队的同学选型AI办公工具,我前后花了差不多两周时间测试,也问了身边好几个朋友。
我之前总觉得AI办公工具选型主要看底层模型的智能程度,但晚点那篇报道里提到了一组数据,非常反直觉。
腾讯做了一个叫WorkBuddy Bench的评测,把七个头部模型分别装进两套不同的执行框架,跑了260项任务。其中办公任务50项,覆盖做表格、写文档、做PPT、处理审批这些日常场景。
结果是,七个模型的办公得分集中在77.47到82.37分之间,最高和最低差不到5分(内容参考晚点LatePost公开报道)
这个数字比我预期的要接近太多了。
1我一开始以为这只是个别现象,是不是评测设计偏简单,没拉出差距?
但仔细想了一下,办公场景的任务本来就和前沿研究不太一样。写一份周报、或者整理同一段会议录音,这些事情的难度天花板是有限的。它需要的是理解指令、调用工具、按格式输出,这些能力在头部模型之间已经高度趋同了。
如果今天模型能力的差距已经缩到了5分以内,那继续在模型这一层上卷,对用户体验的边际提升其实很有限。
晚点报道里还提到一个细节:把同样的模型换一套执行框架再跑一遍,七个模型里有五个得分变化不到2分,中位变化只有0.86分。也就是说,不光模型之间差距小,连换了harness之后的差距也很小。
既然模型不是决定性变量,那什么才是?
2答案可能比模型能力本身更现实。
我在调研过程中试过一段时间海外的产品。单论产品体验,确实做得好,比如我现在日常主要用的就是Codex。
但当我尝试把这个方案推进到团队层面的时候,遇到的第一个问题就是,OpenAI和Anthropic目前都没有正式向中国大陆提供服务。
很多人在讨论AI办公的时候,默认前提是所有产品都摆在桌上,你可以自由挑选。但对中国企业来说,这个前提本身就不成立。
首先是数据合规的问题。国内企业想把日常工作流接到某个AI产品上,企业内部文档、客户信息、业务数据,这些东西存在哪、谁能看、出了事谁兜底,在中国的监管环境下都是必须回答的问题。
还有系统对接,我们日常用的办公软件,海外产品跟这些工具之间没有原生的打通能力,它始终是一个独立于工作流之外的东西。
所以AI办公选型的第一道题,是「谁有资格坐到谈判桌上」。能力再强,进不了你的公司,就跟你没关系。这个筛选条件一加上去,牌桌上的玩家就少了一大半。
3把这个前提理清之后,我就开始理解WorkBuddy的一个设计逻辑了:它不绑定单一模型。
既然头部模型在办公场景的表现差距已经非常小,那绑定单一模型其实是一个风险很高的策略。
今天绑的是最强模型,三个月后可能就不是了。而模型换代的速度,远比产品架构调整的速度快。
WorkBuddy的做法相当于把产品层和模型层做了解耦。同一个任务,用户可以在多个模型之间切换和调度,可以用腾讯自研的混元,也可以接入GLM、Kimi、MiniMax、DeepSeek,企业版甚至允许管理员自己配置模型。
模型怎么迭代、谁超过谁,对产品来说都是增量,而不是需要推倒重来的变量。当各家模型在办公场景的得分差距只有5分的时候,选择权本身就变得更有价值,而且这个差异在未来一两年会越来越明显。
4但还有一层东西,比多模型、合规更难被复制,就是上下文的积累。你让任何一个AI写一份会议纪要,都能写得不错。
但你让它基于这份会议纪要,去判断客户砍价之后方案该怎么改、折扣有没有超权限、应该找谁审批、下一次跟进定在什么时候,它就需要大量这家公司特有的上下文。
这些上下文包括历史报价、审批流程、人员权限、客户沟通记录,散落在文档、邮件、聊天记录、审批系统的各个角落。
一个外来的AI产品要获取这些信息,需要一个一个系统去对接、一条一条数据去打通。而WorkBuddy有一个天然起点:腾讯本身就拥有腾讯文档、腾讯会议、企业微信、邮箱这些企业工作的基础设施。
这些系统里的数据,对WorkBuddy来说不需要从零打通,它从进入企业的第一天就能沿用已有的账号体系和组织架构。
所以当我看到有人问:为什么不用海外产品接一个中间件来打通?
理论上可以,实践上你会发现,中间件能传递的只是数据,传不了上下文。一份会议纪要变成任务拆解的背景信息,这中间需要对业务逻辑、组织架构和历史数据的统一理解,嫁接一层不解决根本问题。
5这几层叠在一起看,会发现一个共同特点:都不是短期能复制的。这也是为什么我觉得AI办公的竞争格局,可能会比很多人预期的更快收敛。
正是因为这些壁垒都需要时间积累,越往后,先到者的优势就越难追赶。模型能力已经不是瓶颈,进不进得来、接不接得住、企业敢不敢用,才是真正的筛选条件。
满足这些条件的选手并不多,而竞争的窗口期,可能比想象中更短。
