塔斯娱乐资讯网

阿里宣布造10万亿参数大模型,我算了算这个数有多离谱

正文昨天云栖大会上了条大新闻,今天早上我翻到的时候愣了一下。 阿里CEO吴泳铭在主论坛上宣布:千问团队计划训练5万亿到

正文昨天云栖大会上了条大新闻,今天早上我翻到的时候愣了一下。
阿里CEO吴泳铭在主论坛上宣布:千问团队计划训练5万亿到10万亿参数规模的新模型。目标是干更复杂、更长程的任务,往超级人工智能那个方向走。
10万亿是什么概念,很多人没感觉。我专门算了笔账。
2025年初爆火的那波AI,你现在手机里可能还在用的DeepSeek-R1,参数量是6710亿。10万亿是它的15倍。去年我们还在讨论"千亿参数是不是极限",一年半之后,头部的玩家开口就是"10万亿起步"。
再看现在已经在台面上的模型。月之暗面的Kimi K3,2.8万亿,是目前开源出去的模型里块头最大的一个。阿里现在的旗舰Qwen 3.8-Max,2.4万亿。DeepSeek的V4-Pro,1.6万亿。
也就是说,阿里这次宣布的目标,比现在所有已发布的国产模型还要再放大三到七倍。
而且阿里不是一个人在玩这个游戏。
同一天有消息传出来,The Information报道称DeepSeek正在训练一个约2万亿参数的新模型,创始人梁文锋在近期的投资者会议上说,下一步计划推到8万亿。字节那边,8月英国金融时报就援引知情人士说,他们在训练一个最高可达10万亿参数的大模型。
阿里、DeepSeek、字节,三家全部押注大参数。去年"参数不重要了,效率才重要"的论调,一夜之间没人提了。
参数到底是个啥写到这里,先给不搞技术的朋友补个课。
参数,你可以理解成模型脑子里旋钮的数量。每个旋钮记录着一小片"经验",比如"看到'今天天气'后面大概率接'不错'"这类语言规律。参数越多,模型能装下的规律就越细,能处理的事情就越杂。
GPT-3那会儿是1750亿参数,当时已经惊掉一地下巴。四年过去,头部模型的参数翻了上百倍。人脑大约有860亿个神经元,听起来参数早就超过人脑了,但神经元的连接方式比参数复杂得多,所以AI离"真会思考"还有距离。这次各家冲5万亿、10万亿,冲的就是把更多规律、更多常识、更多推理步骤塞进同一个脑子。
一个直观的对比:训练2.8万亿参数的Kimi K3,模型文件本体就有1.5TB往上,你笔记本的硬盘都不一定装得下。10万亿参数的模型,光存权重就得几十TB起步,必须拆开摆在成千上万张显卡上。


为什么突然又堆参数了我翻了吴泳铭的演讲全文,发现他给了一个逻辑。
他说今天机器思考的总量还不到人类的3%,未来会达到人类的1000倍以上,机器最终将承担99.9%的思考工作。要让AI干更长程的任务,比如自己设计实验、自己跑数据、自己评价结果,模型的"脑容量"就得跟上。
这个思路业内叫递归式自我改进,模型从真实反馈里发现自己哪不行,自己补,循环往复。千问团队说他们在这方面已经有进展。
翻译成人话:以前的AI是你问一句它答一句的答题机器,下一步要造的是一个能连着干几天的员工。要连着干几天,光会聊天不够,得记住足够多的东西、规划足够长的步骤。参数,就是承载这些能力的底层空间。
开发者在关心什么作为一个天天调API的开发者,我最关心的其实是另一件事:这玩意儿训练完,推理成本会不会爆炸。
先给个定心丸。参数大和用起来贵,这两件事已经不完全挂钩了。现在的主流做法是MoE架构,就是模型总参数很大,但每次回答只激活其中一小部分。Kimi K3总参数2.8万亿,每次激活的大概104B。阿里新发布的Qwen 3.8-Flash-Next,总参数不小,激活的只有6B。
所以你调用的时候,掏的钱是按激活量算的,不是按总参数算的。

但训练成本是真的在往上翻。阿里为了这事,昨天同步发布了新一代自研AI芯片真武V900,算力是上一代的三倍,单一集群可以扩到50万张卡。他们现有基于M890超节点的十万卡集群,已经在跑2万亿参数的模型了。吴泳铭还宣布,到2032年阿里云的全球数据中心规模要超过20GW。
20GW什么概念,差不多是两三个三峡电站的装机容量,专门用来给AI供电。
这些成本最后会不会转嫁到API价格上,我持谨慎态度。目前能看到的是,各家Flash档位的价格还在往下打,GLM 5.3 Flash和千问的Flash-Next都到了每百万tokens输入0.15美元这个档位。大厂在用旗舰模型秀肌肉,用Flash模型抢市场,开发者短期反而是受益方。
还有个细节能说明用量有多夸张。云栖大会上中国平安披露,他们和阿里合作以来,日均消耗的tokens超过3000亿。一家企业的日常调用量就是这个数,整个盘子的消耗可想而知。阿里云CTO昨天还发布了新一代存储系统CPFS,号称能把AI存储成本降69%。算力、存储、网络,整条链路都在为更大的模型做准备。
泼一盆冷水有几个事实得摆出来。
先说一个容易被忽略的点:参数多,和聪明,中间隔着数据。模型参数翻倍,训练数据也得跟着翻倍,而且质量得提上去。堆参数没有好数据喂,等于给一个人无限量供应教材但全是错别字。
第二,参数越大不等于智能等比例增长。同样的参数翻十倍,能力提升的曲线是越来越平的,学术界管这个叫边际收益递减。真正拉开差距的地方在训练效率,用多少电、多少卡、多少天训练出同等的智能。
第三,现在国产已发布模型的顶点是2.8万亿,海外闭源阵营估计已经到了8万亿上下。以10万亿为目标,各家现役旗舰普遍还要放大五倍左右。这个过程中,谁先用更少的电训练出更聪明的模型,谁才有下一轮的定价权。
第四,吴泳铭自己也说了,现在AI编程、AI写作这些应用,还只是机器智能时代早期的"电灯",主要在替代人类已经会干的事。真正的新产品还没出现。10万亿参数的模型训练出来,能不能催生那些新产品,没人打包票。
普通人该关注什么三件事。
一是别急着付费。各家旗舰竞赛期间,免费额度和低价Flash档会越来越多,现在是你白嫖体验的窗口期。
二是关注9月28日的荣耀Magic9发布会。它会成为首款搭载Qwen大模型的AI手机,官方给的综合任务准确率是91.8%。大模型卷到手机里,普通人最先摸到的就是这波。
三是如果你在用API做自己的小项目,留意各家模型的上下文长度变化。参数放大的同时,上下文窗口也在从16万tokens往百万级走,这对你能塞给AI多少材料影响最直接。
参数军备赛重启,短期看热闹,中期看成本,长期看谁能把"思考"真正做成插上插座就能用的东西。
你觉得10万亿参数的模型,最先会用在什么地方?评论区聊聊。
#AI# #大模型# #千问# #DeepSeek# #云栖大会# #科技热点#