榜单上排名靠前的模型,可能只是更幸运地碰到了适合它的措辞。IBM 的一项新研究把这件事拆开来看了:他们提出一种叫 BenchDrift 的方法,在保持标准答案不变的前提下,对基准题目做同义改写——换说法、换指代、调整语用和结构——然后看模型的正确率会不会翻车。结果很反直觉:能力越强的模型,对措辞越敏感。弱模型从改写里多少能捞回一点分数,强模型却是损失远超获益,原本领先的分数优势一改写就可能塌。
这种脆弱性不是个别模型的毛病。研究在 GSM8K、MMLU 和 MATH-Hard 三个不同类型的基准上跑了八款模型,发现它们对"哪些改写最伤正确率"看法高度一致——这意味着问题更多出在数据集本身,而不是某一家模型的发挥。换句话说,你看到的榜单差距,很可能是"提示词运气"的差距,而不是真实能力的差距。
这件事对做严肃评测的从业者有直接影响:在固定一份问法下跑出来的领先优势,本身就该被打折看;想更接近模型真实能力,得在多组措辞下取稳定的那部分结论,而不是被某次恰好合口味的题目抬上去的分数。换句话说,榜单领先不等于能力领先——它只是"这一次问法下"的领先。
你做严肃评测时,会主动拿同义改写再跑一遍模型吗?
