塔斯娱乐资讯网

曾深度参与DeepSeek R1研发的罗福莉,带着她的新模型MiMo-V2.6强

曾深度参与DeepSeek R1研发的罗福莉,带着她的新模型MiMo-V2.6强势登场,不仅拿下了开源模型的第一把交椅,还撂下一句狠话:在创新和工程难度上,它已超越了DeepSeek R1。
现在大模
曾深度参与DeepSeek R1研发的罗福莉,带着她的新模型MiMo-V2.6强势登场,不仅拿下了开源模型的第一把交椅,还撂下一句狠话:在创新和工程难度上,它已超越了DeepSeek R1。

现在大模型行业有个怪象:模仿别人变聪明虽容易,但想自己产生新智能却很难。

很多团队图省事,直接拿顶级模型生成的答案来“喂”小模型,说白了就是吃别人嚼过的饭。

但罗福莉和她几十人的团队,在算力贵得离谱的今天,却走了条最费钱、最难走的路——大规模强化学习(Scaling Up RL)。

这是开源界目前单次消耗算力最多的强化学习训练。

这不单是砸钱买算力那么简单。

懂行的人都知道,如果把各种复杂的任务胡乱堆在一起做强化学习,很容易导致效率低下,让数据变得过时且无用。

MiMo团队通过高超的工程拆解解决了难题:代码和Agent这类有客观标准的硬任务,用MixRL直接开训;而那些耗时极长、涉及主观判断或3D游戏的超难任务,则专门开小灶训练,最后通过MOPD(多目标偏好蒸馏)技术把它们整合起来。



这套组合拳,硬是在算力瓶颈中杀出了一条血路。

最让人震惊的不是技术,而是他们那种“掀桌子”式的开源态度。

他们不仅公开了顶尖模型,还大方地赠送了基于MiMo RL轨迹蒸馏的Qwen模型、7000个多样化交互环境以及整套RL训练框架。

这相当于不仅给出了满分试卷,连学霸的解题思路、题库和辅助工具都打包免费送给了大家。

在如今大厂流程繁琐、部门壁垒严重的背景下,这支高效扁平的团队,硬是把通往AGI(通用人工智能)的未知地带摊开在了大家面前。

当抄袭和套壳成了平庸者的避风港,那些敢于在未知荒野中死磕算力、挑战极限的人,才真正决定了开源AI究竟能走多远。