跑分差距只剩3%。彭博行业研究10月5日的报告,把中美顶尖AI模型的距离摆到了台面上。
高级分析师罗伯特·利亚在报告中写道:DeepSeek 9月发布V4.1 Flash之后,中国顶尖模型在基准测试得分上仅落后美国竞争对手3%。而今年5月这个差距还有约9%,年初时更是约15%。半年时间,差距收窄了大半。
更直观的是排名。在LiveBench的9月全球榜单上,DeepSeek V4.1 Flash位列第六,是自2025年R1模型一鸣惊人以来,中国模型拿到的最高名次。LiveBench的评测方式,是拿问题、谜题和任务去考模型,再对回答与分析打分,思路类似人类做智商测试。DeepSeek这次得分81.1,Anthropic最高分83.4。利亚的结论是:这已经是可以和Anthropic、OpenAI顶尖系统"相媲美"的表现。
为什么会被追上?报告归因于两点:一是中国AI专业能力的持续深化,二是研究人员针对国产硬件优化模型的能力。说白了,拿不到最先进的芯片,就把手里的卡榨到极致。
不过报告也泼了盆冷水,有几点值得冷静看:
第一,榜单前15名里,中国模型只有3个。塔尖能打,整体厚度仍有差距。
第二,跑分不等于赚钱。利亚直言,中国AI行业可能要到2030年才能实现持续盈利——国内大模型超过1100个,低毛利token供给叠加残酷价格战,让谁都难拿到超额利润。
第三,目前只有字节豆包在AI应用变现上跑在前面,DeepSeek、腾讯的聊天机器人仍在免费策略里烧钱。
第四,中国模型正面临日益严格的美国监管审查,甚至潜在禁令风险,模型蒸馏的指责是导火索之一。
报告的原话是:中国模型的进步"进一步让人质疑美国在AI领域的科技主导地位能否长期维持"。从前几年的"代差",到如今的3%,这场竞赛确实换了个阶段。但把分数跑赢,和把商业模式跑通,是两件不同的事。下一步比的,是谁能先让AI自己挣钱。
你怎么看这3%的差距?评论区聊聊。
