塔斯娱乐资讯网

ChatGPT发明人新模型不会写字,我扒了Jev的账单和评测

半夜刷Hacker News,一个发布帖16小时冲到一千四百多分,四百多条评论吵成一锅粥。发帖的人来头不小:Diogo

半夜刷Hacker News,一个发布帖16小时冲到一千四百多分,四百多条评论吵成一锅粥。发帖的人来头不小:Diogo Almeida,InstructGPT论文的作者之一,后来在OpenAI参与了ChatGPT的研究基础。他在隐身两年之后,发了款新模型,叫Jev。这模型有个听着很离谱的特点:它不会写字。你让它写封邮件,做不到。让它总结一份文档,也不行。让它解释一段报错,同样没门。可就是这么个"半残"的模型,把半个开发者社区炸出了连篇累牍的讨论,有人喊五年后才该有的东西提前来了,也有人直接说这是几个月来见过包装味冲天的营销。我花了一晚上扒完发布材料、官方文档和评论区的争论,把账和评测都算了一遍,这篇就聊聊我的观感。
先搞懂Jev是个啥卡尼曼在《思考,快与慢》里把人的思维分成两套系统:系统1快而直觉,系统2慢而审慎。Almeida的出发点就在这:现在的聊天模型全在模仿系统2,一个字一个字往外蹦,推理链拉得老长。可你的代码里,大量的AI调用其实只想要一个决定。这条工单该归哪个组处理?这句话算不算投诉?用户问的是售前还是售后?这种判断每天要跑几万次,每次都让一个大模型先写三百字的思考再给答案,纯属浪费。Jev官方管自己叫System One Model,系统一模型。它不接收聊天消息,你喂给它一个结构化的状态,附上几个问题,它直接吐回类型化的答案。官方只有三种问题原语:头一种叫Choice,从给定选项里挑一个,附带每个选项的概率和置信度。官方文档里有个例子,问一段话属于售前、技术还是销售,返回的是一组概率加一个0.82的置信度,你的代码自己决定0.85够不够高。第二种叫Score,按等级打分。第三种叫Noul,判断一个是非命题,返回0到1的概率。三种问题可以在同一次调用里混着问,官方说多加几个问题几乎不影响响应时间。训练方法也另起了名字,叫RLCD,校准决策强化学习。官方把它摆在RLHF和RLVR旁边,说这是第三条后训练路线。采样方式也换了:不走逐token自回归,用并行采样器一次前向传播给出全部输出。延迟官方报70到500毫秒,对照前沿模型的3到329秒。

账单:便宜是真便宜价格这块我直接报数。输入0.042美元每百万token,输出不计费,官方原话叫"便宜到不用计量"。对比主流对话模型每百万token零点二到十美元的输入价,这个数差着两个数量级。官网首页横幅写着快193.6倍、便宜444.6倍。这个数字来自他们自建的四项决策类工作流对比,我后面会说这组数的成色,先把账摆完。官方还有个Doom演示:Jev每秒做10次判断,控制游戏角色跑图,算下来每小时成本约7美元。每小时七美元听着不便宜,但换成同等的对话模型调用,成本会翻好几倍,这个演示想说的就是单位判断的成本差。评测站上逐项的数据也值得看:四项工作流平均下来,Jev准确率67.8%,单案例成本0.0004美元,耗时0.4秒。对照组里一家旗舰模型是74.1%的准确率、0.0836美元、23.3秒;另一家是73.1%、0.1761美元、37.8秒。决策类任务的速度和成本,确实不在一个量级。
评测:我得泼三盆冷水
头一盆冷水:准确率其实是落后的。67.8%对74.1%,差了六个多百分点。分工作流看更扎眼,发票处理上Jev只有61.8%,对面旗舰接近79%,差了17个点。Jev占住的是一条"没有谁同时比它又便宜又准"的位置,属于省成本的选择,不是提准确率的选择。第二盆冷水:评测是他们自己出的题。四项工作流由公司自己的团队编写,官方自己承认"可能存在偏差";参考答案还是拿两家的旗舰模型在高思考档位下作答取的平均值,等于用账单价顶格的旗舰模型定义正确答案。样本量、置信区间都没披露,那17个百分点的差距有没有统计意义,外人无从判断。第三盆冷水才是要害:他们干脆不发布基准表。发布前四天,公司发了篇文章,标题化用那句老话"谎言,该死的谎言,统计数字和基准测试",列举了榜单被反向优化的好几个例子,宣布以后用日期化的快照评测替代排行榜。这个立场有它的道理,公开榜单确实会被刷。但同一套逻辑反过来也成立:一家公司既有动机给自己打分、又不受第三方榜单约束的时候,你只能选择信或不信。评论区点赞很高的一条批评就一句话:如果分数好看,他们早发了。另外提醒一个容易被营销带偏的点:官方宣传里的"零幻觉",指的是输出永远符合预定义的结构,不会冒出不存在的字段,这是schema约束在数学上的保证。它不保证判断本身是对的。模型完全可以八成的置信度给你一个错的答案。CEO自己在评论区也承认了这点。
开发者视角:方向值得盯,队列可以排泼完冷水说说我为什么还是觉得这事值得跟。有位做过生产自动化的开发者在评论区给了个观察,我觉得很准:一套健康的自动化流程里,决策类调用和生成类调用的比例轻松到十比一,而成本大头恰恰压在决策调用上。这个比例就是Jev这类产品要切的市场。我自己接API做小程序就有体感。现在的做法是提示词加解析,再加schema校验,校验失败还得重试,兜一大圈就为了给下游一个if语句喂参数。偶尔模型还会自作主张回一段"这大概是技术问题,不过也可能是……"的客套话,解析直接崩。Jev把置信度写成了契约:高档自动执行,中档补信息,低档转人工。判断和执行的边界用代码写死,这事想想是挺舒服的。接入路径目前有一条:Vercel的AI网关已经上架了它的提供方,装个SDK配个密钥就能调。直连的API还在排队名单里。限制也要心里有数:32K上下文,只吃文本和JSON,不支持图片,没有配套的执行框架。我的打算:排上队,等资格下来拿工单分类和意图路由两个场景实测,跟现在的方案算笔总账,结果出来写续篇。买入的判断标准很简单,它只要能在同等准确率下把我这部分调用成本砍掉一个数量级,这趟就不白排。

你项目里的AI调用,有多少其实只想要个决定?评论区聊聊。
#AI# #大模型# #API# #ChatGPT# #开发者# #AI工具#