- Published on
DeepSeek V4 Flash 真正改变的是什么 — 这是每单位能力成本的问题,不是排行榜的问题
- Authors

- Name
- Youngju Kim
- @fjvbn20031
- 引言 — 预览版转公开测试版的那天,模型本身却原封不动
- 规格 — 284B 里只点亮 13B 的模型
- 公布的分数是谁测的,用的哪套 harness
- 价目表里真正该看的不是头条,而是缓存命中单价
- 换成每单位能力成本重新计算
- Flash 说的不是延迟,而是一个档位名
- 路由决策规则 — 以及还不知道的事
- 结语 — 排行榜一个月就翻盘,价目表的形状却留得很久
引言 — 预览版转公开测试版的那天,模型本身却原封不动
2026 年 7 月 31 日,DeepSeek 把 V4-Flash API 转为公开测试版。官方更新日志的措辞很准确,这次发布明确写着「保持 DeepSeek-V4-Flash-Preview 的模型架构与规模不变,只重做了后训练」。参数、上下文、价格都照旧。变的只是一层后训练,加上对 Responses API 与 Codex 框架的原生支持。
但公布的分数动得相当大。Terminal Bench 2.1 上 82.7,Toolathlon verified 上 70.3。Hacker News 讨论帖里把它们和预览版时期的数值并排放的人指出,两项分别从 56.9 涨到 82.7、从 51.8 涨到 70.3。也就是说,在权重规模不变的前提下,仅靠后训练就让智能体基准移动了 20 分以上 — 这是一个主张。
本文不去争这个分数排第几。排行榜一个月就会翻盘,而对多数团队来说真正压在身上的问题不是「这是第几名」,而是「我的流量里哪一部分挪过来,账单能少多少、质量会差多少」。所以这里按每单位能力的成本来算,并且每一次都标明哪些数字是厂商自测的。
规格 — 284B 里只点亮 13B 的模型
先把物理事实理清楚。DeepSeek V4 Flash 是总参数 284B、每 token 只激活 13B 的 sparse MoE。上下文 1,048,576 token,最大输出 384K token。纯文本,没有视觉也没有音频。这份规格可以在 OpenRouter 的模型页和 DeepSeek 官方价格文档之间交叉核对。
同系列的上位模型 V4 Pro,据称是 1.6T 总参数、每 token 约 49B 激活。要理解这两个模型的关系,这一对数字就是关键 — 与其说 Flash 是把 Pro 蒸馏或裁剪出来的模型,不如说它更接近一个把激活参数压到四分之一、从结构上把服务成本拉下来的独立架构。所以价格也正好按这个比例走。按输出算,Flash 是每 100 万 token 0.28 美元,Pro 是 0.87 美元,相差约 3.1 倍。
这里经常产生误解。激活 13B 这个数字说的是算力,不是显存需求。如果考虑自托管,284B 的全部参数仍然得放在某处,压到 4 bit 也要 140GB 上下。激活参数小,意思不是「小 GPU 上就能跑」,而是「同一块 GPU 能吐出多得多的 token」。这个区分一旦模糊,自托管的报价就会整个错掉。本地运行那一侧的算术,在本地跑 LLM 到底需要多少 VRAM一文里已经用公式讲过。
公布的分数是谁测的,用的哪套 harness
更新日志公布的 0731 分数如下。Terminal Bench 2.1 为 82.7,NL2Repo 54.2,Cybergym 76.7,DeepSWE 54.4,Toolathlon verified 70.3,Agent Last Exam 25.2,Automation Bench(Public) 25.1,DSBench-FullStack 68.7,DSBench-Hard 59.6。
这些数字附带条件,而这些条件很重要。更新日志把测量方式明确写为「DeepSeek Harness minimal 模式、max effort 档位、top_p 0.95、temperature 1.0」。也就是说,这是用自家 harness、在最高推理强度下测出来的厂商自测值。HN 讨论帖里的质疑也正是落在这一点上。智能体基准对 scaffolding 极其敏感,同一个模型换一套 harness 就能动两位数。一旦把它和别家厂商用自家 harness 发布的数字并排排名次,那张表就失去了意义。
独立测量那一侧如何呢。Artificial Analysis 把 V4 Flash 0731 在最高推理强度下记为 Intelligence Index 50。同一指数上 GPT-5.6 Sol 是 59,Terra 55,Luna 51。也就是说,单看综合智能指标,Flash 大致坐在 OpenAI 最便宜那一档的位置。编程方面的第三方汇总里流传着 SWE-bench Verified 上 Flash 79.0%、Pro 80.6% 的数值,但那是引用 llm-stats 一类汇总的二手材料,原始测量条件我没能确认。不要照单全收,还是用自己的任务去测更好。
有一项独立测量特别有实务价值。Artificial Analysis 记录这个模型跑完整个指数用掉了 210M token,而全部模型的中位数是 62M。它在给出答案之前会消耗非常多的思考 token。这在基准分数里被算作优点,在账单上则被算成输出 token。后面还会再算一次。
价目表里真正该看的不是头条,而是缓存命中单价
按官方价格文档整理各模型每 100 万 token 的单价如下。OpenAI 一侧是反映了 7 月 30 日降价后的值,缓存命中单价则是把公布的 90% 折扣应用到输入价上得到的值。
| 模型 | 缓存命中输入 | 缓存未命中输入 | 输出 | 输出对输入倍率 |
|---|---|---|---|---|
| DeepSeek V4 Flash | 0.0028 美元 | 0.14 美元 | 0.28 美元 | 2 倍 |
| DeepSeek V4 Pro | 0.003625 美元 | 0.435 美元 | 0.87 美元 | 2 倍 |
| GPT-5.6 Luna | 0.02 美元 | 0.20 美元 | 1.20 美元 | 6 倍 |
| GPT-5.6 Terra | 0.20 美元 | 2 美元 | 12 美元 | 6 倍 |
| GPT-5.6 Sol | 0.50 美元 | 5 美元 | 30 美元 | 6 倍 |
这张表里比头条数字更值得多看几眼的是最右边那一列。DeepSeek 的输出是输入的 2 倍,而 OpenAI 系列是 6 倍。价目表的形状本身就不一样。
而最左边那一列更戏剧化。Flash 的缓存命中输入是每 100 万 token 0.0028 美元,只有缓存未命中的五十分之一。和 GPT-5.6 Luna 的缓存命中单价相比,大约便宜 7 倍。HN 讨论帖里有一位用户报告说,30 天内用 3,467 次 API 请求消耗了 323M token,一共付了 4.55 美元 — 这种量级的数字,除非缓存命中率极高的负载,否则跑不出来。反复发送长系统提示词和固定代码库上下文的编程智能体,正是这种形状。
有两个需要当心的坑。第一,缓存折扣率并不等于账单节省率 — 如果输出已经吃掉了成本的一大块,输入侧的 90% 折扣并不能把总额砍掉 90%。这笔账在LLM API 成本如何真正降下来一文里详细算过。第二,DeepSeek 的价格文档预告了高峰与非高峰的差别定价方案。按北京时间上午 9 点到正午、下午 2 点到 6 点这两个区间费率翻倍,但文档写明生效日期尚未正式公布。这两个区间与韩国时区重叠,做报价时必须把它算进去。
换成每单位能力成本重新计算
把同一份负载放到两个模型上做一遍实际的算术。降价后的 GPT-5.6 Luna 与 DeepSeek V4 Flash 在 Intelligence Index 上是 51 对 50,实际上处在同一位置,所以是一对适合固定能力、只比价格的组合。
负载 A — 输入偏重(长文档摘要、RAG 应答)
每次请求输入 50,000 token / 输出 500 token
Luna : 50,000 x 0.20 / 1e6 = 0.01000
+ 500 x 1.20 / 1e6 = 0.00060 -> 0.01060 美元
V4 Flash : 50,000 x 0.14 / 1e6 = 0.00700
+ 500 x 0.28 / 1e6 = 0.00014 -> 0.00714 美元
Flash 便宜约 1.5 倍
负载 B — 输出偏重(推理、编程智能体)
每次请求输入 2,000 token / 输出 10,000 token(含思考 token)
Luna : 2,000 x 0.20 / 1e6 = 0.00040
+ 10,000 x 1.20 / 1e6 = 0.01200 -> 0.01240 美元
V4 Flash : 2,000 x 0.14 / 1e6 = 0.00028
+ 10,000 x 0.28 / 1e6 = 0.00280 -> 0.00308 美元
Flash 便宜约 4.0 倍
还是那两个模型,差距却从 1.5 倍拉到了 4 倍。只看头条输入价是 0.14 对 0.20,差 30%,而实际账单的差距由负载的输入输出配比决定。输出对输入倍率为 2 倍的价目表,输出越长越有利;6 倍的价目表则相反。
这里前面那条观察绕了回来。Flash 是一个会大量消耗思考 token 的模型,也就是说它天然被推向负载 B 那一侧。当输出单价低的价目表遇上大量产出输出的模型,两者会互相抵消,所以在没有实测之前,「输出便宜,那就让它随便想」这个结论是危险的。把推理强度设成 max 测出来的基准分数,和实际服务里所用强度下的成本,是两回事。把强度调低之后分数会掉多少,厂商没有公开,我也没能确认。
Flash 说的不是延迟,而是一个档位名
先把名字带来的一个误解挑明。别家厂商的 Flash 档位大体上意味着「响应快」,但 DeepSeek 的 Flash 不是延迟等级,而是激活参数较小的那一系列模型的名字。实际响应快不快,是完全另一个问题,而且各家提供商之间差别很大。
看 Artificial Analysis 按提供商的汇总,同样是服务同一套权重,输出速度却从每秒一百多 token 散布到每秒接近三百 token,首 token 时间在提供商之间的偏差也非常大。另有基准报告中位吞吐每秒 164.7 token、中位 TTFT 1,924 毫秒。在推理模式下还有一点很重要:「首个 token」和「首个回答 token」不是一回事 — 思考 token 先流出来,所以用户真正看到答案之前的体感延迟远长于 TTFT。如果打算把这个模型接到实时对话式 UI 上,要测的是到首个回答 token 的时间,而不是 TTFT。
还有一点。官方 API 的并发请求上限,文档里写的是 Flash 2500、Pro 500。这是往里灌批量任务时的实际天花板,值得放进容量规划。
路由决策规则 — 以及还不知道的事
把到此为止的数字压缩成决策规则,就是下面这些。
- 输出长、重复前缀大的流量,有明确的理由送到这里。代码评审、大批量分类、日志摘要、内部工具用的智能体都属于这一类。这是缓存命中单价和输出单价同时对你有利的唯一区间。
- 只有输入长、输出短的流量,差距会收窄到 1.5 倍左右。如果已经绑在别家厂商上并且存在迁移成本,那么搬过来的理由并不充分。
- 质量上限决定结果的流量,不要搬。在 SWE-bench Pro 和长周期智能体任务上,与最顶端模型的差距依然实实在在,而在一次失败的代价远高于 token 费用的负载里,比单价本身就是错误的框架。
- 受数据治理约束的流量,无论价格如何都需要单独判断。HN 讨论帖里也反复出现对代码库流向何处的担忧,以及个人订阅者拿不到零留存政策这一点。由于权重以 MIT 许可公开,自托管是一个可选项,这才是这个模型实质性的差异点。只不过,把 284B 撑起来的硬件成本会立刻反弹回来。
没能确认的部分也要写清楚。相对预览版的分数涨幅(Terminal Bench 从 56.9 到 82.7 等)并非出自官方更新日志的同一张表,而是社区把两个时间点的发布值拼接起来的,我没能确认这两个值是否出自同一套 harness。把推理强度调低后的分数与成本曲线、1M 上下文的实际有效长度(性能是否一直保持到最后一个 token)、高峰定价方案的生效日期,也全都未公开。而用自家 harness 测出的智能体分数,在那套 harness 公开之前,不是可比的数字,只是厂商的主张。
结语 — 排行榜一个月就翻盘,价目表的形状却留得很久
这次发布里能留得久的信息不是 82.7 这个分数,而是价目表的结构。输出对输入倍率为 2 倍的价目表和 6 倍的价目表,即便能力相同也会吸引来不同的负载。而「缓存命中单价是未命中的五十分之一」这一行,会把能固定前缀的团队和做不到的团队的账单拉开将近一个数量级。
所以,与其把排行榜再读一遍,不如打开自己的日志。每次请求输入与输出 token 的中位数、前缀复用率、一次失败的成本 — 只要有这三个数字,该送给哪个模型就能算出来。基准只是这个计算的输入之一,而且必须先确认是谁、用哪套 harness 测的,才用得上。