塔斯娱乐资讯网

大模型很快?先拆这4个时间 看到“每秒 176 token”就以为模型一定快?这

大模型很快?先拆这4个时间
看到“每秒 176 token”就以为模型一定快?这是 AI 选型的常见误判:吞吐高,不等于用户更早拿到答案,也不等于便宜。

9 月 2 日,Multiverse Computing 发布 Quasar 438B 新介绍页。官方称它面向智能体,支持 100 万 token 上下文;在 Artificial Analysis Intelligence Index v4.1.1 得分 43,并称“含思考生成 500 token 用时 15.3 秒”。独立评测页记录的输出速度则约为 176.2 token/秒。两组数字不冲突,因为量的不是同一段时间。

收藏这套测速框架:
① TTFT:请求到首个可见 token,决定“有没有卡住”的体感。
② 解码速度:首 token 后每秒输出量,适合比较长回答。
③ 端到端时间:把思考、排队、工具调用、网络和输出全算进去。
④ 成功任务成本:模型费、重试、工具与人工复核成本,除以验收通过数。

第四项尤其关键。Artificial Analysis 记录 Quasar 跑完整套指数时生成约 3.5 亿输出 token,同类中位数约 6700 万。模型可以“吐得快”,但如果更啰嗦,总时间和账单仍会上升;其页面给出的输入/输出价为每百万 token 0.60/1.80 美元。

实测时固定模型版本、推理强度、服务商和题集,同时记录 P50/P95 的 TTFT、端到端时间、输出量、成功率与单次成功成本。100 万上下文只是上限,不代表每次都该塞满。

边界:官方页采用部分对比;独立指数含 9 项评测。数据页标注它仅支持文本、API 只有一个服务商;公开权重与许可证需另行核验。

一手 AI工具 推理模型 智能体