新模型登顶,先别急着切流量
一个新模型刚登顶榜单,团队最危险的动作不是“不跟”,而是当天就把生产流量切过去。Qwen3.8-Max-0902 的新结果,正好适合演示一套更稳的模型迁移门禁。
【来源事实】阿里云 9 月 2 日更新的官方文档把它定义为 Qwen3.8-Max 的升级快照,保留 100 万上下文;最大输入 991,808、最大输出 131,072,支持文本、图像、视频输入,输出文本,并支持函数调用、结构化输出和上下文缓存。
Code Arena 的 WebDev 榜单快照显示,它以 1691 分排在首位,但页面同时写着 Preliminary:只有 1,389 票,误差范围 ±19,名次区间是 1–4。也就是说,“第一”仍是会随投票和统计区间变化的初步位置,不是生产优势的定论。
部署边界更值得看。官方文档中,0902 快照不支持微调,列出的各区域也不支持批量推理;Web Search 在北京、新加坡支持,在法兰克福、弗吉尼亚、东京和香港等区域标为不支持。北京标价为每百万 token 输入 1.65 美元、输出 4.951 美元,新加坡则是 2 美元和 6 美元;基础 TPM 上限也不同。
【专家判断】模型登顶后,建议按这 5 关再决定是否切流量:
1. 版本关:锁定 0902 快照,不把滚动别名混入对比;
2. 任务关:用自家真实仓库、工具链和失败样本做盲测;
3. 统计关:同时看置信区间、票数和失败分布,不只看名次;
4. 成本关:按输入、输出、缓存、工具调用与重试分别计费;
5. 上线关:先影子流量,再小比例灰度,并保留一键回滚。
限制也要写进决策表:WebDev 只覆盖一种开发偏好,官方长时自主编码描述仍是供应商声明;100 万上下文不等于满窗口质量不降,文档也说明实际长度受参数组合影响。真正该收藏的不是冠军名单,而是一张能反复使用的迁移门禁表。
一手 大模型评测 AI编程 模型选型
