塔斯娱乐资讯网

同一台 DeepSeek V4 Pro,同一个 Agent 任务,第一轮工具从

同一台 DeepSeek V4 Pro,同一个 Agent 任务,第一轮工具从 25 个砍到 2 个,分数从 91 跳到 99。这 8 分差,模型没变,是它第一眼看到的工具栏变了。

默认 Standard 模式一上来就把 25 个工具推给模型,开口就容易乱;DeepSeek 内部跑评测走的是极简脚手架,只给 bash 和 str_replace_editor。你拿到的成品,恰好是它训练时没怎么见过的那一面。

修复极便宜。两阶段锚定:先把工具面收成两个,诱导模型做第一次调用,再把完整工具集放出来。实测连稳 98 和 99,跟默认模式的波动完全两个世界。社区已做成补丁 dsh-routing-suite 和 dsh-anchored-standard,本质就是自动帮你做第一轮工具瘦身。

AYi 的解释:V4 Pro 经强 RL 训练,高分轨迹几乎都长在极简接口上,首轮塞 25 个工具等于把它推出训练分布,能力再强也接不住。

最低成本验证:同一任务,Standard 和极简各跑一遍,看思维链第一个词。"let me"开头一般是混乱模式,"we"开头多半在正经规划。不装插件也行,自己写个状态机,第一轮只暴露两个核心工具,等模型真动手再注入其余工具,几行代码的事。

我的判断:眼下当"脚手架敏感型"模型用,性价比最高;补丁是在给模型兜底,长期还得等官方把训练分布补全。

你用 V4 Pro 跑 Agent,Standard 模式下过程跑飞的情况常见吗?