昨天下午我在跑测试,手机突然弹了一条推送,说DeepSeek开放平台发了公告。我点进去一看,心里咯噔一下:9月10日中午12点起,flash系列要执行新定价了。
做小程序的,API价格就是我每个月真实的真金白银。这种公告我不敢只看标题,直接翻到官方页面,把每个数字都抠出来看了一遍。看到一半我就开始拉表格算账了,今天就把我算出来的东西原样分享给你,如果你也在调API,这篇文章能帮你把下个月的账单预估清楚。
先说结论:整体降价,但分时段这次调价核心的变化就一个词:分时定价。
官方公告写得很清楚,从9月10日中午12点开始,flash系列的价格分成了两档。空闲时段,每百万token的输入如果缓存命中,只要0.02元;缓存未命中是1元;输出是4元。
高峰时段呢?全部翻倍。缓存命中0.04元,未命中2元,输出8元。
高峰时段的定义也要记牢:北京时间周一到周五的9点到12点,14点到18点。剩下的时间,包括晚上、周末、节假日,都算空闲时段。

那这次到底是涨了还是降了?我对比了一下调价前的数字。缓存命中的输入,原来是每百万0.05元,现在空闲时段0.02元,直接砍掉六成。缓存未命中从1.5元降到1元,降了大约三分之一。输出从4.5元降到4元,降幅百分之十一左右。
也就是说,只要你会在空闲时段干活,这三项全部降价,其中缓存命中那一档降得最狠。潮新闻的报道里也算了这笔账,结论跟我一致:闲时跑一次标准任务,成本能省百分之十六七。听起来不夸张,但你要是每天调用千万级甚至亿级的token,这就是实打实的钱。
不过有个前提别忽略:高峰时段是空闲的两倍。你要是白天上班时间疯狂调用,输出token按8元一百万算,比原来的4.5元反而贵了快一倍。这次调价不是单纯的降价,是把价格这根指挥棒递到你手上,让你把不着急的活儿挪到夜里和周末去跑。
官方还藏了个彩蛋:不用改代码就能省钱翻公告的时候我还看到一个细节,挺有意思的。
DeepSeek说,在V4.1 Flash正式上线之后、V4.1 Pro出来之前,所有指向V4 Pro的API请求,会被自动路由到V4.1 Flash处理,而且按flash系列的低价格计费。
这意味着什么?如果你的代码里模型名写的是V4 Pro,你一行代码都不用改,明天开始自动用上响应更快的新模型,账单反而变少。有财经媒体给这套策略起了个名字,叫"升级降价同步",这在行业里确实少见。一般厂商上新模型,价格只升不降,这次算是反向操作。
速度方面,内测社区的反馈是V4.1 Flash生成速度大约每秒284个token,现在的V4大约每秒97个。接近三倍的差距,对编程场景来说是质变,你等代码生成的过程中喝口水的次数都少了。当然这是社区测试数据,正式版表现如何,我打算明天上线后自己跑一轮再单独说。
我的三招应对,直接抄作业公告看完,我当晚就把小程序的调用策略改了一遍。三个动作,说给你参考。
头一招,把系统提示词固定住,吃满缓存折扣。缓存命中有个前提,请求的前缀要和之前完全一致。我以前为了调试方便,会在系统提示词里拼时间戳和随机示例,改完之后我全删了。系统提示词越稳定,缓存命中率越高,而这次恰恰是缓存命中的输入降价降得最狠,从五分钱降到两分钱。高频问答类、文档总结类这种前缀固定的场景,受益会非常明显。
第二招,批量任务全部挪到闲时。我有个每天凌晨跑的数据整理任务,原本定在早上八点半,正好撞进高峰时段的头一格。现在改到晚上十一点,单价直接砍半。类似的还有日志分析、批量摘要、向量化,这些不要求实时反馈的活儿,全都适合夜里跑。你写个定时任务,把cron表达式改一下,一分钟的事。

第三招,实时调用该花就花,别硬省。用户在页面上等着对话回复,你总不能让他等到晚上十点。这类流量走高峰价是没办法的事,我的做法是加一层限流和超时熔断,把单次对话的输出长度控制住,token省下来一点是一点。真到了账单吃紧的时候,还可以考虑用本地模型兜底简单请求,GitHub上18万星的ollama就是干这个的,一台普通电脑就能把小模型跑起来,零API成本。
拿我自己的账,粗算给你看光说比例可能没感觉,我把小程序里一个真实场景搬出来算。我的小程序有个"问答助手"功能,用户提问后,系统提示词加知识库前缀大约每次消耗两万token的输入,回答平均输出八百token。
改造前,这些请求全在白天发生,缓存命中不稳定。按老价格,输出每百万4.5元,一天三千次调用,光输出这块就要五块四毛钱,一个月下来一百六十多块。
改造后,前缀稳定让缓存命中率上来了,输入的大头按命中价算,空闲时段只要0.02元一百万。批量整理挪到夜里,输出也从4.5元降到4元。同样三千次调用,我拉表格粗算,一个月能压到一百一十块上下。数字不精确,但方向是对的:前缀越稳、错峰越彻底,省得越多。
要是你的业务全是白天的高峰实时调用,那反过来,账单可能不降反涨。所以今天这篇文章真正想让你带走的是一句话:调价之后,调用时段本身就是钱。
三个坑,提前提醒头一个,时区坑。公告里所有时段都是北京时间,哪怕你在海外调API,计费也按北京时间算。我见过有人在群里问为什么晚上十点还算高峰,一看服务器配置的是UTC时间,差了八个小时。
第二个,缓存命中的脆弱性。前缀只要差一个字符,缓存就全部作废,按未命中计价。所以别在提示词开头拼动态内容,把变量放到请求尾部,这是省缓存钱的基本功。
第三个,别为了省钱牺牲体验。高峰贵一倍听着肉疼,但用户的耐心比token贵得多。该实时响应就实时响应,把省钱的功夫花在批量任务上,方向别搞反了。
写在最后这次调价我个人的判断是利好开发者,尤其是前缀固定、能错峰的用法,降幅相当可观。分时定价这个玩法一旦头部厂商用起来,估计后面同行都会跟上,以后调API可能跟电价一样要研究峰谷了。
明天中午12点新价格生效,留给我们的缓冲时间不多了。你要是也在调DeepSeek的API,建议今天就把调用日志拉出来看一眼:高峰时段占了多少比例,缓存命中率有多高,高峰里有多少请求其实不着急。这三个数字一出来,你下个月是省是涨,答案就在纸上。
你的场景适合错峰吗?评论区聊聊你的调用姿势,点赞过50的话,我出一期完整的账单优化实操,把我的限流和缓存代码直接开源出来。
(作者:AI蟑螂小强)
#deepseek##ai##模型##开发者##热门#