DeepSeekV4.1Flash发布DeepSeek 刚发了 V4.1 Flash,我看完第一反应是:这参数结构有点意思。
552B 总参数,但输入只激活 8B,输出 16B。什么概念?就是大脑很大,但每次思考只调动一小块。成本压下来不说,KV Cache 每 token 只缓存 890 bytes,这才是真正影响推理成本的地方。很多模型吹参数,但部署起来贵得离谱,Flash 这个方向是对的。
更狠的是它把快速、专家、识图三个模式直接合并了,统一由这一个模型提供服务。官方说基准测试超过了 V4 Pro,包括自家旗舰。这就有点不讲道理了,Flash 定位本来是轻量快速,结果智能水平反超旗舰。
API 价格整体下调,峰谷时段也调整了。结合多模态原生支持,这波明显是冲着高频调用场景去的。对开发者来说,便宜、快、还能看图,确实没太多理由不用。
唯一悬念是实际体验能不能撑住这个跑分。等测。



