塔斯娱乐资讯网

作为曾经深度参与过DeepSeek R1研发的AI核心人物,罗福莉这次带来的全新

作为曾经深度参与过DeepSeek R1研发的AI核心人物,罗福莉这次带来的全新模型MiMo-V2.6不仅登顶开源第一,更直接撂下一句重话:

这次在研究创新与工程难度上,已经超越了当初的DeepSeek R1。

如今的大模型行业有个尴尬的真相:复制智能越来越便宜,但创造新智能却越来越难。

大多数团队为了快速出成果,都在拿顶级模型的输出去“蒸馏”小模型,本质上是把别人消化过的食物再嚼一遍。

但罗福莉和她的数十人团队,在算力贵如金条的当下,偏偏选了最不讨巧、也最烧钱的硬路——Scaling Up RL(大规模强化学习)。这也是开源团队迄今为止单次算力消耗最大的单次RL训练。

这绝不仅仅是砸卡那么简单。熟悉大模型训练的人都知道,强行把各种乱七八糟的任务混在一起做强化学习,极容易拖垮采样效率,导致严重的“数据过期”(Rollout Staleness)。

MiMo团队在工程上做出了极度硬核的拆解:能用客观标准验证的硬核任务(比如代码和Agent),用MixRL直接开训打底;对于那些极其耗时、包含主观评估或3D游戏的超难任务,则单独开小灶训练,最后通过MOPD(多目标偏好蒸馏)强力融合。

这种工程巧劲,硬生生在算力墙上凿出了一条新路。

比技术突破更降维打击的,是他们的“掀桌子”式开源。团队不仅输出了顶尖模型,还直接向社区无偿赠送了基于MiMo RL轨迹蒸馏的Qwen模型、7000个多样化交互环境以及完整的RL训练框架。这相当于不仅把高分答案公布了,还顺带把学霸的解法、练习题库和自动化解题工具箱全给社区打包送货上门。

在大厂部门墙高筑、层层汇报的今天,这支扁平化到极致的团队,每天跨领域碰撞智能,把通往AGI的未知硬核地带公开摊在了桌上。

当套壳和复制已经沦为平庸者的避风港,那些敢在未知荒野里抱着算力撞墙的人,才真正决定着开源AI能走多远。