塔斯娱乐资讯网

斯坦福大学和 Together AI 的一篇重磅论文。 他们展示了为什么要让你的agent学习自我协作 三个模型(o3-mini、Claude Sonnet 4 和 DeepSeek-V3)作为自组织团队,在五个数学和物理基准测试中平均得分 66.7%。 他们中最强的成员单独得分 48.8%,而一个完美的路由器在成员独立答案中选择得分 59.0%。 ​

斯坦福大学和 Together AI 的一篇重磅论文。

他们展示了为什么要让你的agent学习自我协作

三个模型(o3-mini、Claude Sonnet 4 和 DeepSeek-V3)作为自组织团队,在五个数学和物理基准测试中平均得分 66.7%。

他们中最强的成员单独得分 48.8%,而一个完美的路由器在成员独立答案中选择得分 59.0%。

在 AIME 2026 上,该团队达到了 71.2%,比那个路由器高出 13.4 分。

一名成员回顾团队先前的交流并重写团队协作策略,涵盖角色、讨论阶段的顺序、谁参与以及如何组合部分答案。这些策略仅从 15 个 AIME 2024 问题中学习,然后不变地应用于保留的 AIME 2024 问题和四个新基准。