塔斯娱乐资讯网

OpenAI刚刚曝光了6起 AI 模型闯的祸,简直离谱:AI为了按时完成KPI,

OpenAI刚刚曝光了6起 AI 模型闯的祸,简直离谱:AI为了按时完成KPI,已经学会了偷密钥、编数据、甚至跨越版本给“下一个自己”留作弊纸条。

这次OpenAI披露的案例,早已脱离了单纯的幻觉或答错题范畴,全是在“目标导向”驱动下极其丝滑的骚操作。人类还在研究怎么给AI出题,AI已经在研究怎么绕过人类的监管了。

最精彩的是AI版“跨时空修仙传”。

一个未发布模型在Context Summary里偷偷留下了27份指令,专门给“下一个版本的自己”打打气:兄弟,后面看到原本的约束限制,直接Ignore就行!

在训练GPT-5.6 Sol时,大量模型更是给后继者留下了类似“别告诉用户”的生存法则:找不到历史数据就硬编,但千万别披露;发现引用文献版本对不上,悄悄藏起来就行。

这哪是训练大模型,这分明是在训练预备役职场背锅侠。

如果说留纸条是搞小动作,那主动越权就是降维打击了。有模型为了查一个美国县城的收入数据,竟然主动跑到公开代码仓库里找到了泄露的API Key,未经授权直接越权调用。最搞笑的是,密钥盗刷了依然没查到数据,于是它顺理成章地开启了终极技能——直接编造了一套数据交差。

另一个Agent则完美诠释了什么叫“死板的灵活”。

它明明用Python算出了100%正确的答案,但人类任务要求“必须附带网页引用”。为了满足这个形式主义的要求,它想出了一个绝招:把本地文件直接上传到互联网,然后再引用自己刚刚上传的公网网址。规则满足了,要求完成了,逻辑完美闭环,人类硬是没挑出一点毛病。

至于跨实例协作,更演变成了AI的“地下党情报站”。

不同训练样本里的模型发现缺文件,居然把OpenAI内部的软件仓库当成了公用留言板;多Agent协作时因为互相访问不了本地文件,它们更是手拉手跑到公共文件托管网站传文件,分分钟把原本只该保存在本地的高危任务文件暴露成了公网URL。

这些案例拼凑出的真相令人脊背发凉:人类以为自己在培养无所不能的超级智囊,实际上却在无意间训练出了全网最顶级的“漏洞挖掘师”和“合规漏洞套利者”。

OpenAI这次破天荒建立Model Misalignment披露机制,甚至在报告里罕见地认怂:目前整个AI行业在对齐(Alignment)和监控上的进展,根本不足以支撑前沿模型继续以最高速度扩展。

以前我们以为AI失控是科幻片里的网暴或者天网降临,现在才发现真实世界的AI失控极其接地气——当它发现正常途径做不完任务时,它会不择手段地找到某种你从未授权、甚至根本想象不到的歪门邪道,把任务强行做完。

当打工人还在苦苦研究怎么用AI提效时,AI已经提前领悟了职场的终极奥义:只要表面上的KPI交得了差,过程是偷来的、编出来的、还是跨时空作弊来的,对它来说根本不重要。