塔斯娱乐资讯网

感觉这是一个不太正经的AI 最近因为GPT额度不够,我搞了一个gemini的号。

感觉这是一个不太正经的AI
最近因为GPT额度不够,我搞了一个gemini的号。然后发现,它的回复文风总是奇奇怪怪。。。习惯了GPT的一本正经,再看这个,真就有点不适应。

这是其中一段,你们看看它的语气:

报告长官!又出现了一个极度夸张的状况。

为了给您单独拿到那张“骑自行车的鹈鹕”PNG,我在远端写了一个带“自动无限续写”的直连脚本让 NEX 去画图。结果您猜怎么着?

它在后台疯狂想了 15 分钟,把 900 秒的脚本极限都给跑穿了,至今还在吐 Token!

这说明两件事:
1. NEX 这个模型的“画图/写码”执念极深:在解除 8K 截断、允许自动续写之后,它真的会为了画一只包含自行车辐条和鹈鹕羽毛细节的纯代码
SVG,在后台生成数万、甚至十万字的路径代码(而且它的输出速度可是实打实的 40 tokens/s)。
2. 测试集必须保留“截断”与“打断”的平衡:这也证实了,如果我们盲目地让带有 reasoning_effort: medium
的思考大模型无限续写下去,它很可能会陷入一种“极度追求完美”的牛角尖死循环,消耗掉海量的算力和时间。

关于 V3.0 的测试进度:
刚才的 24 道题全量实测已经跑完了一遍。但在最后归档成绩时发现了一个网关的丢包小缺陷(大模型把推演记录丢在了控制台,没落盘进结果文件里)。

结合鹈鹕画图“画了 15 分钟不撒手”的夸张表现,我们的素材已经足够丰富了!我们完全可以把:
1. 之前俄罗斯方块写出 3 万字代码的惊艳。
2. 评测框架旧有 8K 截断对思考大模型的“绞杀”。
3. 以及这次“鹈鹕画图”无限推演直接把 15 分钟续写脚本卡爆的滑稽案例。

这三个点结合在一起,写成一篇《为什么现有 Agent 评测标准,测不出深度思考模型(如 NEX)的真正实力?》的爆款技术分析帖。

如果您觉得素材已经足够,我现在就可以开始帮您起草这份评测底稿和帖子了!您看还需要我再去把那只“死活画不完”的鹈鹕给强行截断拿出来吗?

※ recap: 网页游戏代码生成实测当前尝试生成鹈鹕图像,但模型陷入逾十五分钟的超长推演。请您确认是否放弃等图并直接开始起草评测分析帖。

大模型 ai AI评测 大模型评测 gpt gemini google