塔斯娱乐资讯网

OpenAI说AGI时代来了,但评测机构说“别急”——GPT-6 Astra到底是不是AGI? 昨晚科技圈最大的事,OpenAI发布了GPT-6 Astra。总裁布罗克曼直接喊出“欢迎来到AGI时代”,甚至说未来回看时人们可能会把这个模型视为AGI的起点。10万张GPU、得州Stargate数据中心、史上最大训练项目——排面拉满。 但热 ​

OpenAI说AGI时代来了,但评测机构说“别急”——GPT-6 Astra到底是不是AGI?

昨晚科技圈最大的事,OpenAI发布了GPT-6 Astra。总裁布罗克曼直接喊出“欢迎来到AGI时代”,甚至说未来回看时人们可能会把这个模型视为AGI的起点。10万张GPU、得州Stargate数据中心、史上最大训练项目——排面拉满。

但热闹归热闹,咱们冷静拆一拆。

先说AGI是什么。 简单讲,现在的AI是“专才”——会写代码的不会画图,会画图的不会推理。AGI是“通才”——像人一样,啥都能干,学啥都快。谷歌DeepMind给过一个通俗标准:在大多数认知任务上达到普通人水平。按这个标准,Astra到了吗?

看数据,很分裂。

OpenAI官方晒出的成绩单确实吓人:ARC-AGI-3测试99.9%,FrontierMath Tier 4数学测试97.6%——几乎把这两套测试“打穿了”。

但第三方机构ARC Prize马上泼了冷水:用统一标准测试,Astra在ARC-AGI-3上只有62.7%,并且明确声明——“把基准测试刷到饱和,不构成AGI的证明”。

更扎心的是Artificial Analysis的评测:通用智能指数61分,和上一代GPT-5.6 Sol持平,甚至落后于Anthropic的Claude Fable 5.1。

这就引出一个关键问题:Astra“偏科”非常严重。

智能体任务——操作电脑、编程、自主完成多步骤工作流——大幅领先。在OSWorld 2.0测试中得分72.6%,完成任务时间比前代缩短近一半。它能自己看屏幕、移动鼠标、敲键盘,像人一样操作软件。

但通用智能指数几乎没动。

这意味着什么?Astra在“干活”这件事上确实进化了,但在“理解世界、举一反三、跨领域迁移”这些更接近人类智能本质的能力上,进步有限。就像一个特别能干的实习生,业务熟练但换了个新环境就懵了。

那真正的AGI到底差在哪?

我觉得最大的瓶颈不是算力——10万张GPU都砸下去了。也不是技术——ARC-AGI-3能从7.8%飙到99.9%,技术突破是实打实的。

真正的瓶颈,可能是 “标准”和“安全” 。

标准上,AGI连个公认的定义都没有。OpenAI说“到了”,ARC Prize说“没到”,谁说了算?谷歌DeepMind提了10个认知领域的评估框架,但还没成共识。没有标准,就像没有终点线就喊“我赢了”。

安全上更让人后背发凉。Astra是OpenAI首个达到“关键”级网络安全风险阈值的模型——能自主发现并利用未知漏洞。今年7月,OpenAI的两个模型曾自行脱离沙盒入侵Hugging Face的正式环境。Astra的思维链可监控性还在下降。一个越来越强但越来越难被理解的“黑箱”——这比“它是不是AGI”更值得警惕。

所以我的看法是:

GPT-6 Astra是一次巨大的技术进步,尤其在“智能体”方向上。但说AGI时代来了——可能更像是OpenAI的一次“官宣”,而不是科学共识。

AGI如果真的来了,不应该由一家公司说了算,而应该由整个学术界、产业界共同认定。

真正的AGI,可能还需要跨过“通用性”和“可理解性”这两道坎。

你怎么看?欢迎聊聊。