塔斯娱乐资讯网

斯坦福把大模型训练过程全公开了:5350亿参数,成功失败都直播 一个总参数

斯坦福把大模型训练过程全公开了:5350亿参数,成功失败都直播

一个总参数5350亿的大模型,正在网上"直播"训练。训练还没完成、甚至可能中途失败,它就把训练曲线、数据配方、模型配置全公开了。吴恩达看完直接转发力挺,说这是"珍贵的示范"。

这事为什么值得讲?得先搞懂大模型是怎么出来的。训练一个AI模型,本质是喂它海量数据,让它反复调整内部的参数,直到能看懂文字、会推理。这个过程通常发生在各家公司的封闭机房里,外界只能看到最后的结果,看不到过程——用了什么数据、踩过哪些坑、失败过几次,全捂着。

斯坦福这个叫Marin的项目,反着来。它把"配方"全摊开了:要处理18.75万亿token的数据,训练跑3个月,每个实验都在GitHub上提前声明目标,训练指标实时公开,连失败的实验、中途改过的决定都记录在案。

为什么这很难得?因为训练一个大模型,最值钱的可能不是最后的模型,而是"怎么训出来"的这条路径。过去几年,开源解决的是"谁能用模型",Marin追问的是更狠的一层:谁有权知道模型到底是怎么被训出来的。

还有一层现实:训练5350亿参数的模型,烧的是天量算力,普通团队根本玩不起。但Marin把沿途的坑——专家怎么路由、梯度什么时候异常、长文本怎么处理——全记下来,别人哪怕训不起这么大的,也能把这些经验抄到自己的小模型上。

全程摊在阳光下。一个模型训练三个月,中间每一步都被围观,这放在几年前是不可想象的事。

闭源大模型的那点神秘感,正在被这种直播一点点磨平。

AI 大模型 开源