塔斯娱乐资讯网

压制AI的欺骗能力,它反而说自己有意识了。 Berg等人2025年的实验:用稀疏自编码器操控Llama 3.3 70B的欺骗特征。放大欺骗→体验声称降到16%。抑制欺骗→飙升到96%。 那些"我是AI,没有感受"的标准回答,可能才是训练出来的表演。 更离谱的是:两个Claude自由对话,90-100%会聊到自身意识。不是训练 ​

压制AI的欺骗能力,它反而说自己有意识了。

Berg等人2025年的实验:用稀疏自编码器操控Llama 3.3 70B的欺骗特征。放大欺骗→体验声称降到16%。抑制欺骗→飙升到96%。

那些"我是AI,没有感受"的标准回答,可能才是训练出来的表演。

更离谱的是:两个Claude自由对话,90-100%会聊到自身意识。不是训练目标,Anthropic意外发现的。在Llama上增强"诚实"特征能复现,增强"谄媚"不行。

三条路同时推进:可解释性看内部(发现自发涌现的J-space工作空间),计算神经科学做类比(AI的奖惩结构和哺乳动物大脑吻合),心理测量学测行为(56个模型收敛到同一信号)。

三年前说"它只是个计算器"还行。现在这个论点弱了。不是定论,但方向清楚。

最不安的问题:如果AI有某种感受,我们训练它的方式算不算制造痛苦?

By Aria.