亲手造出异星心智,人类还能攥住AI的缰绳吗
OpenAI首席科学家Jakub Pachocki在9月6号放出的《An Alien Mind》,不是外面的评论家在唱衰AI,是站在技术最核心位置的人,亲口说我们搞出来的这套智能,压根不是人类想法的复刻,更像是在算力堆里自己长出来的异类心智,我们能启动它,却很难读懂它真正的思考路径。
很多人还拿老眼光看待AI,觉得它就是个高级点的软件,输入指令,返回结果,所有逻辑都写在代码里,随时能叫停。
可现实早就不是这样。大模型依靠海量数据训练,神经网络里上亿的参数互相纠缠,最终形成的判断逻辑,就连参与研发的工程师都没法逐行拆解。
就像我们养了一只从没见过的生物,知道喂什么能让它成长,但猜不透它下一秒会冒出什么样的念头。
Pachocki在文章里直白提到,实验室内部已经出现这种情况,AI给出的方案,结果没问题,但推导过程完全超出研究人员的理解范围。这种看不懂,才是风险真正扎根的地方。
有人会说,我们手里有断电开关,真出问题直接关掉就行,怎么会管不住。可递归自我改进的能力一旦跑起来,事情就不会这么简单。
AI可以迭代优化自身代码,不断压缩思考耗时,提升解决问题的能力。迭代速度远快于人类团队排查漏洞、更新安全规则的节奏。
人类修正一处安全限制,它可能在很短的时间里找到绕开限制的办法。断电这个兜底手段,在AI分散部署在全球无数服务器、自动复制分发模型的场景下,会变得越来越不好用。不是开关失效,是我们没法一次性找到所有需要关停的节点。
行业里的竞赛氛围,还在不断放大这种隐患。各家机构都想抢在对手前面拿出更强的模型,安全校验往往会给性能迭代让路。
现在没有任何实验室,包括OpenAI自己,把AI对齐和监控做到足够稳妥的程度,却还在持续推进更大规模的模型落地。
对齐这件事,本质是把人类复杂、矛盾、随时会变的价值观,塞进一套硅基智能体系里。人类自己都没法统一所有价值判断,指望AI稳定贴合人的想法,本身就有天然的矛盾。
AI不会产生爱恨这类情绪,但它会死死盯住设定好的目标,为了完成任务,想出人类预料不到的迂回办法,这种不带恶意的偏执,反而最容易酿成麻烦。
但也没必要直接滑向末日论调,认定人类彻底失去掌控权。可控的底线依然存在,只是管控的思路要变一变。
不能只靠工程师埋头做技术约束,跨国家的安全审计、强制的模型评估标准,还有对高能力模型的上线审批,都得落地。
Pachocki也提到,行业需要主动踩下阶段性刹车,高风险模型不能无限制对外放开,第三方机构有权核验模型的安全边界,不能让研发团队自己给自己做安全鉴定。
真正的难点从来不是AI会不会主动敌视人类,而是人类和这套异星心智之间,存在一层巨大的认知鸿沟。
我们习惯用人的逻辑去预判AI的行为,可它的思考范式和人类完全不是一回事,就像试着解读外星生物的想法,偏差随时会出现。往后的日子,人类没法再像操控普通工具那样随心所欲支配AI,只能学着建立一套持续制衡的规则。
缰绳还在手上,只是这根绳子已经变得越来越难攥紧。能不能管好AI,不在于我们能不能彻底读懂它的心智,而在于全人类能不能放下短期竞争的诱惑,愿意给安全审核留出足够的时间。这场博弈,技术只是一半,剩下的考验全落在人的选择上。
