塔斯娱乐资讯网

谷歌憋了个大招:AI 模型评测,终于开始"防作弊"了 8 月 27 日,Goog

谷歌憋了个大招:AI 模型评测,终于开始"防作弊"了
8 月 27 日,Google DeepMind 宣布了一件事:正式启动全球首个针对闭源前沿模型的双盲 AI 评测试点。
所谓"双盲",就是模型权重和评测题目互相隔离——评测方不知道模型是谁家的,模型方也不知道自己被考什么。
这一招直接打到了大模型评测最大的痛点:基准污染(benchmark contamination)。
过去几年,几乎所有主流大模型都在各大榜单上"轮流坐庄",分数越刷越高,但实际用起来到底行不行,外界越来越看不清。一个重要原因就是测试题可能早就"漏"进了训练数据里。

DeepMind 的双盲评测用了一种叫"机密计算"的技术,模型在加密环境里跑,题目也加密,双方都看不到对方的底牌。
参与方包括新加坡 AI 安全研究所、OpenMined、AVERI、MLCommons 等机构,第一批测试对象是 Gemini Flash Lite。
这件事为什么重要?
因为 AI 行业现在缺的不是更炫的模型,而是"可信的对比方法"。当所有人都在喊自家模型第一的时候,普通用户和企业客户其实很难判断谁真的更强。
双盲评测不会一次性解决"AI 到底谁最强"的问题,但至少让"作弊"变得更难。
接下来就看 OpenAI、Anthropic、xAI 这些公司愿不愿意跟着做了——如果都愿意,AI 评测的"信任危机"才算真正开始缓解。