塔斯娱乐资讯网

把Grok 4.6、DeepSeek V4 Pro、Gemini 3.7 Fla

把Grok 4.6、DeepSeek V4 Pro、Gemini 3.7 Flash同周更新的新闻摆一起,容易先产生一种错觉:长程Agent时代来了,每家都能让模型自己测自己改。Grok 4.6甚至声称在Artificial Analysis Intelligence Index上和GPT-5.6 Sol持平。听起来模型已经会自我闭环。

但DeepSeek V4 Pro的Code Agent结果附了一条不起眼的注脚:跑在自家Harness极简模式下,使用指定采样参数。这一行把"模型"和"执行环境"拆开——决定结果的还有Harness、工具调用、超时和上下文管理。发布会上的执行优势,是被精心调过的环境里跑出来的,不是裸模型自己长出来的能力。

长程任务的瓶颈已经不是"模型会不会写代码",而是"模型会不会识别哪些结果已被环境证实、哪些只是推断"。DeepSeek同时把接口兼容、思考分档、闲时定价三件事一起放出,意味着执行层正在按传统计算平台思路管理队列、服务等级和单位任务成本,多模型路由与缓存会成为下一阶段标配。

复测要盯四点:多轮任务里环境反馈能否送回下一轮、Harness在不同仓库权限下是否稳定、思考预算分档在不同任务上的收益、闲时价格的时段和地区边界。这四点不摸清,复现成本会直接落到开发者日常的集成、调试和账单上。

你们团队在真实代码库或多轮Agent任务里复测Grok 4.6或DeepSeek V4 Pro时,Harness层面的环境反馈是不是稳定送回了下一轮?