DeepSeek V4.1 Flash 发布后,我去海外社区翻了一圈。
结论是:这玩意最离谱的,根本不是跑分。😂
先说第一个。
1M 上下文的全局 KV Cache,居然只有约 890MB。
以前大家一聊长上下文,显卡先跪:
“哥,真装不下了。”
DeepSeek:
“没事,我给你压。”
相比初代,KV Cache 直接缩了约 437 倍。
然后更离谱的来了。
552B 参数的大模型,已经有人拿一张 RTX 5090 + 128GB 内存硬跑起来了。🤣
秘诀也很朴素:
显存放不下?
那就把专家参数扔 NVMe,需要谁再临时叫谁上班。
冷的时候大概 5 token/s,缓存热起来以后甚至能冲到 20+。
有一种“公司 5520 亿员工,但每天只有一小撮人来上班”的美感。
但我觉得最有意思的是第三个。
有人拿它跑 Agent,一小时 773 次 API 请求,狂吃接近 2 亿 input token。
听起来是不是感觉信用卡已经冒烟了?
结果最后不到 1 美元。😳
因为 99% 都命中了 Cache。
这就出现了一个很反常识的事情:
以后 Agent 贵不贵,可能越来越不是看模型,
而是看你的 Harness 到底聪不聪明。
Context 塞多少?
多久 Compact?
Memory 怎么取?
每轮是不是把祖宗十八代聊天记录又发一遍?
模型厂商已经开始疯狂帮你省钱了。
接下来最烧钱的,
可能是你自己写的那坨 Agent。😂
所以 V4.1 Flash 真正释放的信号也许是:
下一场 Agent 战争,
不一定先卷模型。
可能先卷“谁更会喂模型”。
#DeepSeek #Agent #AI #VibeCoding #大模型
