DeepSeek宣布Flash系列模型降价:输出降至每百万Token4元
DeepSeek开放平台发布调价公告,北京时间9月10日12时起,Flash全系列大模型启用峰谷分时计价,空闲时段输出Token下调至每百万Token4元,缓存命中输入最高降幅达60%,同步上线新一代V4.1‑Flash模型,官方测试宣称综合性能全面超越前代旗舰V4‑Pro,进一步拉低企业大规模AI调用成本。

一、新定价规则:区分高峰、空闲双时段
本次调价覆盖deepseek‑v4‑flash、deepseek‑v4‑flash‑vision‑exp两款模型,采用国内少见的分时计费模式。
1、空闲时段(工作日晚间、周末节假日)
缓存命中输入:0.02元/百万Token;缓存未命中输入:1元/百万Token;输出:4元/百万Token
2、高峰时段(工作日9:00‑12:00、14:00‑18:00)
全部项目为空闲时段的2倍,输出8元/百万Token。
缓存命中针对长会话、重复上下文场景,适合Agent、知识库问答、批量文档处理,这一项从原先0.05元降至0.02元,降幅60%,高频复用上下文的业务账单下降最为明显;普通输入Token降幅约33%,输出价格下调约11%。
二、V4.1‑Flash新模型同步转正,旧旗舰自动迁移
本次并非单纯降价,V4.1‑Flash正式对外提供API服务,采用全新非对称MoE架构,原生支持视觉多模态,KV‑Cache占用大幅下降,推理速度显著提升,官方基准测试在代码、数学、工具调用等任务指标超越老旗舰V4‑Pro。
官方设置平滑迁移策略:9月14日12点之后,原有调用V4‑Pro的API请求无需修改代码,自动路由到V4.1‑Flash,并且按照Flash低价计费,实现“更强能力、更低价格”的无感升级,老V4‑Pro逐步下线退市。
Flash系列定位高吞吐、高并发商用场景,支持1M上下文窗口,最大输出384KToken,适配知识库RAG、智能体、内容生成、代码补全、多模态解析等业务,适合面向C端的SaaS产品做大规模对外服务DeepSeek。
三、分时定价带来的利弊与业务影响
对于企业开发者,闲时调用成本极具竞争力,适合离线批量处理、文档解析、数据清洗、夜间异步任务,能显著压缩AI资源开销。但面向用户实时交互的线上业务,大多落在工作日高峰窗口,需要承担翻倍价格,架构上需要做好流量错峰调度、队列削峰。
缓存命中的大幅降价利好长会话Agent应用。大量智能体持续携带历史上下文,会反复命中KV缓存,这部分成本大幅下降,有利于降低复杂智能体产品的运营成本。但如果会话上下文每次完全更新,则享受不到缓存优惠。
开发者需要注意账单变化,上线前后做好压测与成本监控;面向公网的业务,要区分高峰/闲时流量占比重新测算预算,避免高峰期用量突增带来成本超预期上涨。
四、行业启示:大模型价格竞争走向精细化
国内大模型价格战已经从单纯“拼低价”,进化到分时调度、缓存差异化定价、架构优化降本新阶段。DeepSeek这套峰谷计费逻辑,本质是利用算力闲时富余产能,把闲置算力以折扣价释放给离线任务,提升GPU资源利用率。
过去厂商统一一口价,没有区分算力忙闲;分时模式下,离线批处理可以拿到极低价格,实时在线业务承担更高成本,引导开发者合理分配任务。同时,新模型依靠模型架构优化,降低HBM显存消耗,从技术底层压缩推理成本,而不是单纯依靠补贴降价。
这也给行业带来新参考:后续更多大模型服务商,可能跟进推出峰谷、缓存分级的精细化计费方案。
总结
DeepSeekFlash系列将空闲时段输出降至4元/百万Token,叠加缓存输入大幅降价,配合V4.1‑Flash性能升级,给RAG、Agent、批量AI处理场景提供高性价比选择。但高峰时段价格翻倍,企业需要结合业务流量模型,做好错峰调度与成本管控。
大模型竞争已经进入“性能+架构+定价策略”综合比拼阶段,算力调度、缓存计费这类运营层面的设计,会直接决定AI应用商业化落地的盈亏空间。
闽公网安备 35021102000564号