塔斯娱乐资讯网

GPT-5.6跑了16小时,协和医生解开22年数学难题

8月14日,康奈尔大学数学家Alex Townsend和华盛顿大学教授Anne Greenbaum公开了一篇文章,介绍了
8月14日,康奈尔大学数学家Alex Townsend和华盛顿大学教授Anne Greenbaum公开了一篇文章,介绍了一项刚刚得到专家确认的数学突破。
北京协和医院神经外科博士后、住院医师金山木,在GPT-5.6 Sol的帮助下,完成了Crouzeix猜想的证明。
这个猜想由法国数学家Michel Crouzeix在2004年提出,已经困扰数学界22年。Townsend、Greenbaum以及Crouzeix本人都详细检查了论文,并认为证明正确。
不过,作者公开仓库仍将其称为“候选证明”,正式的期刊同行评审尚未完成。更准确的说法是:关键专家已经确认,完整学术程序还在继续。

图1:Townsend与Greenbaum 8月14日发布的专家文章首页,以及金山木照片。来源:原文PDF。

他不是数学教授,而是一名神经外科医生金山木本科读的是地质学,后来取得医学学位,目前在北京协和医院从事神经外科工作。
他接受过的正式数学教育,主要是普通理工科本科课程。更深入的矩阵分析知识基本依靠自学。
金山木接触这个问题,也与医学研究有关。他在研究经颅超声时需要理解复杂的矩阵计算,因此开始学习矩阵分析,后来注意到了Crouzeix猜想。
这个猜想研究的是:一个矩阵经过多项式运算后,结果最多会被放大到什么程度。
2007年,Crouzeix证明上限可以控制在11.08;2017年,这个数字被降低到约2.414。但数学家真正想证明的最优数字一直是2。
金山木的论文给出的正是这个“2”。

图2:矩阵数值域示意图。下方原文写明,两位文章作者和Crouzeix本人均已详细检查证明,并认为手稿正确。

GPT-5.6连续运行了约16小时这次最受关注的部分,是GPT-5.6并不只是帮忙润色论文。
专家文章称,论文中最关键的定理来自一次约16小时的GPT-5.6 Sol自主运行。OpenAI官方将GPT-5.6 Sol定位为面向复杂专业工作的旗舰模型。
金山木为模型设置了一套特殊任务方式:
不允许访问公开网络和其他外部资料;同时安排多个子智能体探索不同证明路线;避免所有智能体过早集中到同一个思路;对候选证明反复进行反驳和审查;在找到能够经受检查的完整证明前,不提前停止。任务开始后,金山木没有继续干预。约16小时后,模型给出了关键证明思路。
他的公开仓库中已经放出论文、原始提示词、不同阶段的手稿、Lean 4形式化代码和公理审计,其他研究者可以继续检查。

图3:专家文章对16小时自主运行、多子智能体探索和对抗审查流程的说明。

这算不算“AI独立解决”?如果说完全由AI独立完成,也不够准确。
问题由金山木选择,任务方式由他设计,最终论文也由他发布并承担责任。公开仓库的表述是:ChatGPT参与了证明开发、论文准备和对抗检查。
但如果只说AI是“辅助工具”,又低估了它的作用。专家文章明确指出,决定性的关键定理来自那次16小时运行。
这更像是一次人与AI共同完成的数学研究:人负责选择问题、搭建研究流程和公开结果,模型负责长时间探索、推翻错误路线并寻找关键证明。
目前没有可靠公开信息说明这次究竟调用了多少个子智能体、消耗了多少Token、花费多少钱。社区里的相关数字只能算推测,不能当成正式结论。

图4:金山木论文《The numerical range is a 2-spectral set》首页。

另一组数学家也给出了独立证明金山木的首版论文在7月27日公开。
仅仅八天后,荷兰代尔夫特理工大学的Emiel Lorist和特温特大学的Felix Schwenninger又提交了一篇只有5页的独立证明。
两篇论文使用了不同的方法,但得到相同结论。第二篇论文也明确披露,他们曾使用ChatGPT 5.6 Pro探索证明策略,正文则由两位作者完成并负责。
这意味着,AI不仅参与了一篇偶然出现的证明,还在短时间内帮助不同研究者找到两条不同路线。

图5:Lorist与Schwenninger 8月4日提交的独立证明首页。

最后说结论这件事的重要性,不只在于GPT-5.6又做对了一道难题。
过去我们判断模型能力,通常看考试分数和跑分;这一次,它在一个持续16小时的真实研究任务中,参与提出了能够通过专业数学家检查的关键证明。
它也说明,未来做研究的人未必都来自传统专业路径。一名神经外科医生,因为医学问题接触矩阵分析,再借助AI进入数学研究,最终解决了一个22年的公开问题。
但AI生成的证明仍然需要专家审阅。模型可以加快探索,真正判断证明是否成立,现阶段依然离不开专业研究者。
接下来最值得关注的,是金山木的论文能否顺利通过正式同行评审,以及这种“长时间运行、多路线探索、反复审查”的方法,能否在更多科学问题上重复成功。
文末互动如果AI能够帮助普通专业人士进入陌生学科并解决问题,你觉得未来最先被改变的会是数学、医学,还是工程研发?