Anthropic 的 Dario Amodei 提了个事,说要给大模型迭代踩刹车。马斯克和奥尔特曼都跟着应了。新闻出来那天我正好在盯训练日志,扫了一眼评论区,全是说这帮人搞垄断的。说实话,从搞技术的人角度看,他们担心的那个点确实存在。
模型迭代这玩意儿,现在有个很具体的瓶颈。参数规模每往上翻一倍,能用的数据质量就往下掉一截。你拿 7B 模型那套清洗好的语料去训 70B,梯度下降的方向就开始飘。这不是什么玄学,是数据分布的客观限制。Anthropic 之前出过技术报告,里面提到过合成数据的比例问题。他们自家模型训到后面,真实人类写的高质量文本越来越不够用,只能拿模型生成的数据去喂模型。这东西一多,模型的输出分布就会变窄,看起来格式越来越规整,但碰到稍微偏一点的问题就开始复读。马斯克在 X 上发的那条,说数据墙快撞上了,我觉得他指的就是这个。
奥尔特曼那边响应,情况稍微有点不一样。OpenAI 现在手里攥着最多的算力集群,如果真放缓,他们的折旧周期会被拉长。一个 H100 跑满寿命大概三到四年,现在行业平均迭代速度是六到九个月推一版。新模型还没把老显卡的算力吃透,下一代硬件就出来了。这种资本开支的节奏一旦被打乱,财报上会很难看。所以 OpenAI 嘴上说放缓,实际动作可能只是把下一个版本的发布时间往后挪一个季度,同时把算力预算砍掉 20% 来对冲。
Anthropic 自己其实也在算这笔账。他们背后是 Google 的 TPU 集群,跟 Nvidia 的生态不完全一样。Google 的 TPU 在跑大 batch size 的时候吞吐很高,但碰到长上下文的注意力机制就有点吃力。Amodei 说放缓,可能也是想争取时间,看看新架构能不能把 TPU 的优势真正发挥出来。现在强行推更大参数量的模型,大概率只是在重复 scaling law 的边际递减。
扯远了。其实最直接的考量是监管压力。欧盟的 AI Act 已经生效了,美国这边行政令也卡得严。模型越大,部署到端侧的难度就越高,最终能真正落地的场景反而变少了。你做个 1T 参数的模型出来,客户拿不到本地部署,全得走他们的 API 按 token 收费。这生意越做越重,不如现在停下来,把 70B 级别的模型做扎实,利润率和客户粘性都更好看。





