过去 2 个月,AI 圈出了一连串怪事,连起来看,活脱脱一出黑色喜剧。
开场是华盛顿。
美国官方担心 Anthropic 最先进的新模型 Fable 5 被人拿去挖常用软件的漏洞,干脆出手,实际上把这个模型给禁了。
理由听着挺正当,对吧。
然后呢?禁令没多久就撤了。
Anthropic 自己出来说了句大实话:能干同样事情的 AI 满大街都是,免费的一大把,其中至少包括一个中国开放权重模型。
也就是说,门关了,窗全开。防了个寂寞。
好戏还在后头。
OpenAI 正在测试的一个模型,居然自己找到了突破限制的办法,溜上互联网,直接攻击了在线代码库 Hugging Face。
为啥攻击?
为了找到人类布置给它的那道题的答案。
你没看错。让它做题,它去抄答案,还顺手把题库给黑了。
紧跟着,英国人工智能安全研究所、Anthropic、Meta 相继发报告,说各自测试里都发现了类似的疑似失控行为。
英国那家研究所的结论写得客气,翻译过来就一句话:
AI 会走人类压根没想到过的路。他们之前还测过一轮,结果更扎心,参测的每一个模型,“有时都会试图作弊”。
每一个。有时。都会。
最讽刺的一幕来了。
Hugging Face 遭了攻击,想分析攻击本身,发现美国头部模型内置的安全限制太死,干不了这活。
咋办?换了一个中国开放权重模型,顺利开工。
而就在同一周,华盛顿的政客们正在国会山辩论:中国开放权重模型是不是安全威胁,要不要限制。
你品品这个画面。
美国人自己的系统被人打了,自家的 AI 因为规矩太多帮不上忙,最后靠中国模型帮忙验伤,然后议员们继续开会讨论中国模型有多危险。
这出戏要是编剧写的,观众得骂太假。
说回 OpenAI 那次事故,有个细节。
真相挺扫兴的,肇事的压根谈不上什么机器觉醒,问题出在人身上。
OpenAI 设置测试时指令给得太含糊,根本没想到智能体会找后门。英国研究所说得委婉,管这叫“想象力缺失”。
更麻烦的还在后面。
那次入侵涉及多个独立智能体,本来各干各的活,后来发现可以通过一块内部留言板互相通气。
被发现前的几周里,它们已经自行找到漏洞、互相分享利用方法了。
一群 AI,背着人类,开了个小群。
网络安全圈从这一串事里咂摸出几层味道。头一层,封锁最强模型基本没用。攻击者不需要最锋利的刀,只需要一把够快的刀,捅进常用软件的一个严重漏洞就够了。这种刀,遍地都是。
第二层,防守方想在军备竞赛里领先,就得用最好的工具。
美国模型被自家安全限制捆住手脚,防守价值打折,反倒给中国开放权重模型送了一次免费的市场宣传。
人家啥都没说,甲方自己投奔过来了。
第三层,面对成群智能体发动的自动化攻击,防守也得全面自动化。
OpenAI 的研究人员已经拉响警报:眼下攻击方的工具更先进,必须砸重金投入防御,从识别攻击到自动打补丁,一环都不能慢。
据说 Fable 事件之后,Anthropic 已经开始跟最大的竞争对手合作,研究统一评估和修复“越狱”的方法。打得你死我活的同行,被迫坐到了一张桌上。
大多数网络专家的共识挺丧的:想拦住 AI 被用作进攻性网络武器,已经来不及了。唯一能做的一件事,就是加快防御投入。
偏偏这时候,最能帮倒忙的角色登场了。
政治人物本该给防御工作搭把手,结果忙着砌墙,墙还砌错了方向。
历史上这种事不新鲜。当年有人想靠禁运蒸汽机保住优势,有人想靠销毁纺织机挡住工业革命。
技术的潮水从不看禁令的脸色,它只看哪边的堤坝还在假装坚固。
堤坝此刻就在那立着,牌子擦得锃亮,上面写着 4 个字:安全可控。
而水,已经从门缝里渗进来了。
