同一段文本,GPT-5.6 Sol 用 766 个 token,Claude Opus 5 约 1,170 个,差 34.5%。只看每百万 token 的美元单价挑模型,等于把两个完全不同刻度的尺子拿来比谁更便宜。
不同模型的分词器不一样,切法不一样,token 数就不一样。它不是克,也不是千瓦时,是一个没法直接对齐的"单位"。单价那栏看着更便宜的模型,等量文本烧出来的真金白银可能更多。
打个比方就好懂。两个一样的披萨,一个切 8 块、每块标价 2 美元,总价 16;另一个切 16 块、每块 1.25 美元,总价 20。表面单价低的那个,其实更贵。
这事对按月跑 API 的人后果挺直接:账单上的数字,和你精打细算选出来的"便宜模型",经常对不上。英文、技术文档、多语言混合、数字密集型的工程文本里,分词粒度的差异会让某些模型悄悄多吃三四成 token,月结时累计下来差距就很实在。
补一句边界:上面 766 和 1,170 是 Tibo 在 X 上做的一次小型对比,不是什么权威基准,换语种、换文档类型,比例还会动。
所以拿来拍板的,应该是同一段输入、同一段输出,在你自己业务文本上跑一遍,得出的总价和效果,再决定贵不贵。比较"每次成功结果的价格",比盯着 token 单价靠谱得多。
你平时挑模型,是直接看 token 单价,还是会先拿自己的业务文本跑一遍再算账?

