产品服务

帝恩思产品矩阵

一站式域名管理与DNS优化专家,致力于让您的在线业务更稳定、更快速、更安全,助力您轻松驾驭数字世界,实现无限可能!

查看全部产品 >
在线工具

帝恩思域名检测工具箱

面向站长、运维工程师、企业IT 人员,一站式域名与网站检测工具箱。快速排查异常,辅助 DNS 运维与安全自查。

首页 / 资讯 / AI智讯 / DeepSeek宣布Flash系列模型降价:输出降至每百万Token4元

DeepSeek宣布Flash系列模型降价:输出降至每百万Token4元

时间:2026-09-11 10:35:09 来源:51DNS.COM
分享:

DeepSeek开放平台发布调价公告,北京时间9月10日12时起,Flash全系列大模型启用峰谷分时计价,空闲时段输出Token下调至每百万Token4元,缓存命中输入最高降幅达60%,同步上线新一代V4.1‑Flash模型,官方测试宣称综合性能全面超越前代旗舰V4‑Pro,进一步拉低企业大规模AI调用成本。

DeepSeek

一、新定价规则:区分高峰、空闲双时段

本次调价覆盖deepseek‑v4‑flash、deepseek‑v4‑flash‑vision‑exp两款模型,采用国内少见的分时计费模式。

1、空闲时段(工作日晚间、周末节假日)

缓存命中输入:0.02元/百万Token;缓存未命中输入:1元/百万Token;输出:4元/百万Token

2、高峰时段(工作日9:00‑12:00、14:00‑18:00)

全部项目为空闲时段的2倍,输出8元/百万Token。

缓存命中针对长会话、重复上下文场景,适合Agent、知识库问答、批量文档处理,这一项从原先0.05元降至0.02元,降幅60%,高频复用上下文的业务账单下降最为明显;普通输入Token降幅约33%,输出价格下调约11%。

 

二、V4.1‑Flash新模型同步转正,旧旗舰自动迁移

本次并非单纯降价,V4.1‑Flash正式对外提供API服务,采用全新非对称MoE架构,原生支持视觉多模态,KV‑Cache占用大幅下降,推理速度显著提升,官方基准测试在代码、数学、工具调用等任务指标超越老旗舰V4‑Pro。

官方设置平滑迁移策略:9月14日12点之后,原有调用V4‑Pro的API请求无需修改代码,自动路由到V4.1‑Flash,并且按照Flash低价计费,实现“更强能力、更低价格”的无感升级,老V4‑Pro逐步下线退市。

Flash系列定位高吞吐、高并发商用场景,支持1M上下文窗口,最大输出384KToken,适配知识库RAG、智能体、内容生成、代码补全、多模态解析等业务,适合面向C端的SaaS产品做大规模对外服务DeepSeek。

 

三、分时定价带来的利弊与业务影响

对于企业开发者,闲时调用成本极具竞争力,适合离线批量处理、文档解析、数据清洗、夜间异步任务,能显著压缩AI资源开销。但面向用户实时交互的线上业务,大多落在工作日高峰窗口,需要承担翻倍价格,架构上需要做好流量错峰调度、队列削峰。

缓存命中的大幅降价利好长会话Agent应用。大量智能体持续携带历史上下文,会反复命中KV缓存,这部分成本大幅下降,有利于降低复杂智能体产品的运营成本。但如果会话上下文每次完全更新,则享受不到缓存优惠。

开发者需要注意账单变化,上线前后做好压测与成本监控;面向公网的业务,要区分高峰/闲时流量占比重新测算预算,避免高峰期用量突增带来成本超预期上涨。

  

四、行业启示:大模型价格竞争走向精细化

国内大模型价格战已经从单纯“拼低价”,进化到分时调度、缓存差异化定价、架构优化降本新阶段。DeepSeek这套峰谷计费逻辑,本质是利用算力闲时富余产能,把闲置算力以折扣价释放给离线任务,提升GPU资源利用率。

过去厂商统一一口价,没有区分算力忙闲;分时模式下,离线批处理可以拿到极低价格,实时在线业务承担更高成本,引导开发者合理分配任务。同时,新模型依靠模型架构优化,降低HBM显存消耗,从技术底层压缩推理成本,而不是单纯依靠补贴降价。

这也给行业带来新参考:后续更多大模型服务商,可能跟进推出峰谷、缓存分级的精细化计费方案。

 

总结

DeepSeekFlash系列将空闲时段输出降至4元/百万Token,叠加缓存输入大幅降价,配合V4.1‑Flash性能升级,给RAG、Agent、批量AI处理场景提供高性价比选择。但高峰时段价格翻倍,企业需要结合业务流量模型,做好错峰调度与成本管控。

大模型竞争已经进入“性能+架构+定价策略”综合比拼阶段,算力调度、缓存计费这类运营层面的设计,会直接决定AI应用商业化落地的盈亏空间。

关键词:

联系我们