榜单上的分数,多少是 harness 挣
这两年有个词慢慢热起来了,叫 harness engineering。意思很直白:把「围绕模型搭系统」当正经工程做,不是提示词写完就收工。
为什么突然重要了?一个很直接的原因。你去翻 agent 评测榜单,同一个模型换一套 harness,分数能差出一截。SWE-bench 早就这样,OpenHands、SWE-agent 这些开源框架,底层模型是同一个,结果各走各路。说穿了,榜单分数里有一块是 harness 挣来的,不全是模型的本事。
对普通人,这事有两个坑要绕。
选工具的时候,别死盯着「它家接了什么模型」。两个产品都说自己挂了最新模型,一个顺手一个卡顿,差别多半在 harness。多拿真实任务试,看它怎么拆长任务、任务翻车了怎么补救、什么时候回头来问你。这些才是体验的大头。
另一个坑是自己搭 agent。先把骨架立起来,再折腾模型。见过有人调提示词调了一周,回头一看,问题是工具返回没做截断,上下文早被日志灌满了。先把四件事定死:怎么装上下文、怎么给工具、什么时候收手、出错了怎么办。这四样定了,再换模型对比才看得出好歹。
模型会一直换,harness 上的功夫是留下来的。
AI Agentharness大模型AI工具





