塔斯娱乐资讯网

终于开源了 dots3-note Preview 终于可以认真写下这件事了:do

终于开源了 dots3-note Preview
终于可以认真写下这件事了:dots3-note Preview 开源了。🚀

发布之后一直在和 infra 同学排查修复 API 效果异常的问题,直到今天才终于有时间坐下来写这条。

dots3-note Preview 是一个 280B 总参数、16B 激活的多模态 MoE,面向复杂推理和 long-horizon agent。模型权重已经开放,现在也提供免费的 OpenRouter 和官网 API。

这是我的团队共同完成的一次阶段性交付。

为了把模型整体效果真正做出来,团队里的每个人都经历了很多轮反复、失败和重新再来。很幸运能和这样一群人并肩工作,也非常为他们感到骄傲。

这次有两个问题,让我越来越确信值得继续做下去:

1️⃣ Continual learning / memory

真实世界的任务不是一问一答。

模型需要在交互中发现未知规则、形成假设、验证假设、更新 memory,并让新的理解真正改变下一步行动。

图 4 是 dots3-note Preview 在 ARC-AGI-3 里的一段真实过程。Memory 不只是把更长的历史塞进 context,更重要的是:模型能不能在行动中持续学习?

2️⃣ Ultra-long-horizon RL

如果一条 rollout 要运行十几个小时,RL 怎么在任务完成之前就知道模型哪里做对、哪里做错?

TEMPO 是我们对这个问题的一次尝试:在 macro-step 边界让生成式 Critic 进行 self-critique,通过 test-time-scaled value estimation 估计未来回报,把任务完成前的中间判断变成学习信号。

在开放环境里,recursive self-critique 会很关键。

当然,这仍然只是 Preview,还有很多不完善的地方。如果大家在使用中遇到任何问题,欢迎随时私信反馈。

开源不是终点,只是一个 small but mighty step。我的团队还会继续往前走。

我们也还在招聘,希望邀请更多志同道合的人加入我们,一起探索这些真正困难、也真正重要的问题。

开源模型 大模型 Agent 强化学习