塔斯娱乐资讯网

一道被宣传为能拦住化生武器讨论的安全过滤器,在 Anthropic 那里悄悄停转

一道被宣传为能拦住化生武器讨论的安全过滤器,在 Anthropic 那里悄悄停转了将近一年,期间大约有五万名外部承包商和模型累计产生了 1.33 亿次对话。

按理说,承包商本身就是帮模型校准安全边界的那群人,他们每天输入的内容五花八门、边界试探最多,恰恰是最该被这道过滤器盯紧的环节。结果整整十二个月,这道生物分类器是关着的;承包商背景核查也只外包给了第三方供应商,Anthropic 自己都承认筛查标准常常不够严格。

等到这份自家安全报告披露出来,公司同时还在另一件事上做减法:研究人员抱怨过滤太激进,他们就放宽了 Fable 5 上对应的分类器阈值。一边在叙事里把 AI 协助开发化生武器挂在最高风险位,一边在执行端把两道相关的安全护栏同时往松里调,方向是反的。

最让人多想一秒的不是“出过事”,而是“没出事”。Anthropic 自己的事后调查也没找到实锤滥用,于是故事落点变成“空窗持续近一年却无人察觉”。这种事后说一切正常、事前却跑了 1.33 亿次未拦截对话的过程,对重度依赖 Claude 做研究或写敏感题材的人,意味着你的提示词在很长一段时间里可能并没有被那道最响亮的过滤器看过。

这家公司正在用最严的措辞讲 AI 风险,但风险最高的那一格监控格子却空了快一年,优先级错位的代价最后还是落到用户头上。问题是,知道这件事之后,你还按原来的方式把敏感话题丢给 Claude 吗?