DeepSeek V4 通过三个渠道销售,价格各不相同:订阅制编程 Agent、直接 API 密钥和网关。每个渠道对由哪个模型检查点处理请求的承诺也不同。2026 年 8 月 16 日,检查点差异成了最要命的问题。DeepSeek 调整 V4 定价后,经销商纷纷跟涨。随之而来的投诉潮暴露出一个事实:大多数客户根本不清楚自己买的是什么。
2026 年 8 月 16 日 DeepSeek V4 定价发生了什么变化?
DeepSeek 于 8 月 16 日 16:00 UTC 将 V4 系列改为高峰/低峰分层定价。高峰时段为 01:00-04:00 和 06:00-10:00 UTC,计费恰好是低峰费率的两倍。低峰时段 V4 Flash 价格为每百万 token:缓存命中输入 $0.007 / 缓存未命中输入 $0.22 / 输出 $0.66;高峰时段翻倍。V4 Pro 低峰价格为 $0.022 / $0.66 / $1.98。
最受关注的是缓存命中价格的大幅上涨。InfoWorld 报道某些费率涨幅超过 10 倍。V4 Pro 低峰缓存命中价格上涨了六倍以上,高峰价格则上涨了十二倍以上。DeepSeek 此前对缓存命中的折扣约为 98%,远高于行业约 90% 的惯例。因此,每个 Agent 账单中的很大一部分都是按接近零的价格计费的缓存读取。
正因如此,此次调价对编程 Agent 的冲击远大于聊天界面。Agent 每一轮都会重新提交冗长的系统提示词加上不断增长的对话历史,大部分输入 token 因此都属于缓存命中。缓存命中价格一涨,Agent 首当其冲。
OpenCode Go 为什么削减了 DeepSeek 限额?
OpenCode Go 每月 $10,最初宣传可覆盖高达 $60 的聚合模型用量。DeepSeek 公布新费率后,同样的 $10 能买到的 token 大幅缩水。OpenCode 在数小时内就削减了上限:V4 Flash 下降 50% 至每月 $30,V4 Pro 下降 75% 至每月 $15。
r/opencode 上反应很快。一篇标题为”Bye bye OpenCode Go”的帖子获得了 315 个赞和 108 条评论,另一篇关于 Flash 预算的帖子又增加了 173 条。次日,OpenCode 将 Flash 限额回调,CEO 的公开解释获得了 1,517 个赞,成为当周最高赞帖子。
同样的逻辑适用于任何固定费用经销商。固定月费订阅本质上是转售上游的按量计费容量,上游的价格风险由经销商自行承担。上游涨价 10 倍,经销商要么吃掉利润,要么提价,要么削减上限。OpenCode 在不到一天内公开削减了上限,比大多数经销商更快也更坦诚。但买家仍然面临一个明确的权衡:固定月费背后是别人的成本结构,而这个结构随时可能变。
你拿到的是真正的 DeepSeek V4 Flash 吗?
真正让人不安的,是你无法确定。
DeepSeek V4 Flash 基于量化感知训练构建。路由专家约占模型的 96%,原生以 MXFP4 精度存储;其余参数使用 FP8 或 BF16。正是这种架构让已发布的权重能够展现其宣称的行为。然而许多 Serverless 供应商在此基础上对激活值额外施加 fp8 量化,以降低自身的推理成本。ZenMux 的基准测试报告详细描述了这一后果:响应偏离参考权重,两个标注相同模型名称的供应商返回的结果存在可测量的差异。
同样的机制也让”相同提示词,不同回答”这类投诉不再只是个例吐槽,而是有了可验证的解释。它还引出了一个更尖锐的问题。OpenCode 仓库中有一个未关闭的 issue,#40409,记录了一份报告称 Go 的 deepseek-v4-flash 自我识别为 DeepSeek V3.2,知识截止日期为 2025 年 5 月,而用量却按 V4 Flash 配额计费。请将此视为一位用户对未解决问题的报告,而非已确认的发现。自我识别本身并不可靠:模型从训练数据中学习自己的版本号,而非从服务栈中获取。该 issue 仍然开放且具体,尚无反驳发布。
无论该 issue 最终如何解决,这个实践教训都成立。可复现性要求供应商披露每个请求由哪个检查点、哪种精度提供服务。大多数订阅省略了这一披露,因为跨上游的池化路由正是固定费用模式可持续的前提。
购买 DeepSeek V4 的三种方式如何比较?
| 编程 Agent 订阅 | DeepSeek 直接 API | 网关 | |
|---|---|---|---|
| 计费方式 | 固定月费,有配额上限 | 按量计费,高峰/低峰分层 | 按量计费,一个密钥跨供应商 |
| 检查点保证 | 通常不披露 | 参考权重,第一方 | 因供应商而异;接入前需确认 |
| 价格变动风险 | 经销商吸收,然后调整上限 | 你直接承担 | 可切换到其他上游 |
| 模型覆盖范围 | 精选列表 | 仅 DeepSeek | 数百个模型 |
| 最适合 | 突发探索性编程 | 可复现及低峰批处理任务 | 多模型生产流量 |
买家再也不能对表格里曾经不屑一顾的那一行视而不见了。价格和覆盖范围在落地页上很容易对比,但来源可追溯性默认无处披露——而它恰恰是这个月发生变化的方面。
你应该如何访问 DeepSeek V4?
根据对工作负载真正重要的保证来选择,而不是看宣传的费率。
- haimaker.ai — 一个 OpenAI 兼容端点,统一接入 DeepSeek V4 及数百个其他模型,内置逐请求成本日志。供应商调价会出现在你自己的遥测数据中,而不是社区论坛帖子里。当你需要网关的广度且路由仍需可审查时,选它。AI API 网关页面完整介绍了路由模型。
- DeepSeek 官方 API — 参考实现,也是唯一能让你确定性地确认检查点的来源。适合能将推理调度到低峰时段的工作负载,此时 Flash 输出价格为每百万 token $0.66。
- OpenCode Go 及类似订阅 — 适合以固定月费应对突发性工作负载。8 月讨论帖中的多位用户表示,即使削减后的每周限额也难以用完。权衡是:你收到的检查点无法被验证。
- 其他网关 — OpenRouter 路由来自 80 多家供应商的 400 多个模型,并提供显式路由模式。不过整合正在加速:Stripe 同意以超过 70 亿美元收购 OpenRouter,是其三个月前 B 轮估值的 5.4 倍。
当供应商已经选定、只需要配置细节时,DeepSeek 在 OpenCode 中的配置指南包含了供应商配置块以及常见的 /models 故障模式。关于哪个低成本 API 值得申请密钥这个更广泛的问题,最便宜的 AI API 密钥覆盖了低于前沿定价的层级,OpenRouter 替代方案则对网关进行了正面对比。
在下一次调价之前你应该做什么?
DeepSeek 在一个月内两次调整价格。高峰/低峰分层表明,驱动这一约束的是可用容量而非利润率。当时一位 OpenCode 工程师的解读是,涨价反映的是流量管理而非财务困境。如果这个解释成立,未来的价格变动将更多由调度驱动,而非回归此前的费率。
最省事的准备是在你自己的基础设施上记录每个请求的成本。这样下一次费率调整会先出现在你的监控指标中,而不是 Reddit 帖子里。将模型名称和 base URL 放在配置文件中而非硬编码,也能减少切换摩擦——上游切换变成一次部署,而非代码库重构。之后,关键的架构问题是:工作负载是否真的需要经验证的检查点。解决这一个问题,其余决策就变成了标准的价格比较。
一个限制仍然存在:这些细节目前无法从外部针对每个请求进行验证。没有主要供应商在其 API 响应中包含推理精度或检查点哈希。在此之前,确认模型来源只能直接向供应商询问,而非依赖独立检查。
常见问题
OpenCode Go 比 DeepSeek API 便宜吗?
对于突发性的探索性工作,固定月费订阅是合理的:固定成本可以吸收用量尖峰,而按量计费会因这些尖峰产生高额费用。但在持续高负载场景下,直接调用 API 通常更便宜,尤其是在低峰时段。它也是唯一能让你确认哪个检查点实际处理了某个请求的途径。
为什么不同供应商的 DeepSeek V4 Flash 回答不一样?
DeepSeek V4 Flash 采用量化感知训练,路由专家原生以 MXFP4 精度存储,其余参数使用 FP8 或 BF16。许多 Serverless 供应商为了降低推理成本,会在激活值上额外施加一次 fp8 量化,导致输出偏离已发布的参考权重。实际效果是:两个供应商虽然标注了相同的模型名称,却可能返回存在可测量差异的结果。
2026 年 8 月 DeepSeek V4 定价发生了什么变化?
高峰/低峰定价于 2026 年 8 月 16 日 16:00 UTC 生效。高峰时段为 01:00-04:00 和 06:00-10:00 UTC,费率恰好是低峰价格的两倍。缓存命中输入的涨幅最大,在某些层级上高达约 1,100%,对依赖提示词缓存的 Agent 工作负载造成了最沉重的负担。