9 月 10 日,DeepSeek 将一项服务价格下调至 0.02 元,较此前的 0.05 元下降 60%。如果只看价格,这容易被理解为又一次常规促销。但素材显示,此次调价对应的是新模型 V4.1 Flash 的发布:其 KV Cache 内存占用被压缩到前一代的 1/4,对硬盘的需求降至 1/8。换句话说,这不是单纯让利,而是模型结构变化后,推理环节成本被重新定价。
价格下调背后:AI 的“草稿纸”变小了
KV Cache 可以理解为大模型在多轮对话和长任务中的“工作记忆”。模型需要保存此前输入和上下文,才能在后续推理中继续接住问题。普通对话里,这部分开销并不显眼;但在长上下文、多轮交互和 Agent 场景中,KV Cache 会持续累积,占用大量内存。
素材指出,对于需要反复回看自身记录的 Agent 类应用,这部分“草稿纸”费用往往构成总成本中最厚的一层。过去许多产品为了控制成本,只能把上下文切短,或限制模型记忆长度,导致长程任务难以顺畅运行。
V4.1 Flash 的改进正落在这里。官方数据显示,新模型将 KV Cache 占用的内存压缩到前一代的 1/4,同时把硬盘需求压缩到 1/8。对开发者和产品方而言,这意味着同样长度的任务、同样的记忆命中条件下,单次推理所需的资源占用显著下降。
读写分离与 MoE:成本下降来自结构变化
素材提到,V4.1 Flash 采用了“读”和“写”分离的结构。过去,多数模型处理输入与生成输出使用同一套计算路径;而新模型将读取输入的部分做得更轻量,每次约唤醒 8B 参数,生成答案时使用约 16B 参数。由于输入侧读取次数较少且更紧凑,保存下来的上下文记录更短,后续生成阶段再回看这些记录时,占用也随之降低。
该模型总参数规模为 552B,但并非每次推理都调用全部参数,而是采用 MoE 混合专家架构,每次任务只激活其中一部分。素材用“552 人的公司,每次只叫 8 到 16 个人上场”来解释这一机制。
从公开报价看,这次结构优化直接体现在缓存命中的单价上:闲时调用缓存命中单价从 0.05 元降至 0.02 元,降幅 60%。同时,DeepSeek 设置了峰谷价格,闲时价格为高峰时段的一半,意在引导用户把重负载任务安排到低谷时段。
对国产大模型服务的影响:长任务成本曲线被压平
对于普通聊天场景,用户感知最直接的是价格下降。但对国产大模型服务更值得关注的变化,在于长任务成本曲线的改变。素材提到,此前不少 AI 自动化产品因为记忆占用过高,难以承担长程运行成本,只能压缩上下文、缩短任务链路。当 KV Cache 占用降为原来的 1/4,长程自动助手、带持久记忆的客服、运行数百轮的调研型 AI,开始在成本层面具备可行性。
这类变化可能影响国产大模型服务的定价逻辑。过去,模型厂商常用单次调用价格吸引开发者;但在真实应用中,尤其是 Agent、长上下文处理和多轮自动化流程里,成本更多取决于上下文保持、缓存命中和反复推理的累计开销。DeepSeek 此次把缓存命中价格打到 0.02 元,释放出的信号是:推理成本竞争正从“单次回答价格”转向“长任务综合成本”。
同一天,DeepSeek 还将原来的“快速 / 专家 / 识图”三个模式合并为“智能模式”。用户无需手动选择轻量档或深度档,系统会根据输入复杂度、是否为图文内容自动分配算力。这一调整说明,随着底层模型能力提升,产品层正在减少人工选择,把资源调度交给模型自身判断。
素材还提到,在 DeepSeek 发布新模型并宣布降价当天,港股大模型公司股价出现波动:智谱下跌 11%,MinMax 下跌约 9%。市场将其与 DeepSeek 同时发布新模型和大幅降价联系在一起,投行也提示价格竞争可能加剧。
从行业角度看,这次事件的焦点并非又一个更大的参数规模,而是推理链条中的真实瓶颈被重新计算。当缓存命中费用从 0.05 元降到 0.02 元,国产大模型服务的竞争维度也在发生变化:谁能把长上下文、长任务和 Agent 场景的成本压低,谁就更可能影响下一阶段的开发者和产品选择。
原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/deepseek-jiang-huan-cun-jia-ge-ya-dao-02-yuan-yi-ci-mian