7月31日下午,DeepSeek悄悄上线了一次API更新。没有新架构,没有更多参数,甚至连模型尺寸都和三个月前的预览版一模一样——只重做了一遍后训练,编程Agent跑分直接翻了六倍多。
这一刀,切在了整个行业”堆参数才是硬道理”的信仰上。

9项基准全线碾压
先摆数据。DeepSeek V4-Flash正式版在9项Agent基准测试中的表现:
Terminal Bench 2.1拿到82.7分,对比预览版72.1分,已经逼近Opus-4.8的85.0。DeepSWE从预览版的7.3飙升至54.4——这不是百分之几十的提升,而是6倍以上的跃升。NL2Repo 54.2、Cybergym 76.7、Toolathlon 70.3、DSBench-FullStack 68.7,每一项都大幅超越V4-Pro-Preview三个月前的成绩。
更值得玩味的是价格。缓存命中低至0.2元/百万tokens,每百万输入token约0.14美元,而GPT-5.5的同级调用要5美元。价差接近36倍。

后训练:被低估的能力杠杆
业界长期存在一个共识:模型能力主要取决于预训练阶段投入的算力和数据。后训练——包括指令微调、强化学习、偏好对齐等——更多是”锦上添花”,让模型更好地遵循人类意图,而非真正提升底层能力。
DeepSeek V4-Flash正式版的结果,正在动摇这个共识。
2840亿总参数的MoE架构,每次推理仅激活130亿——激活参数占比4.6%。架构没变,尺寸没变,只是重新做了一遍后训练。数据工程加强化学习环境设计的组合,把DeepSWE从7.3拉到54.4。这意味着,在预训练算力边际收益递减的大背景下,后训练可能成为性价比最高的能力杠杆。
对于算力受限的团队来说,这是一个重要信号:不需要更多GPU,可能只需要更好的训练策略。
主动适配Codex:明牌抢生态
V4-Flash正式版原生支持Responses API格式,并针对性适配了OpenAI的Codex编程工具。这意味着开发者可以直接在Codex的工作流里跑DeepSeek的模型,无需改造接口。
这是一个很有深意的选择。模型层和工具层正在解绑——开发者不再被绑定在某一家模型上,而是根据任务需求灵活切换。OpenAI的护城河正从”模型能力”退守到”产品体验”。
与此同时,V4-Flash的MIT协议权重已在HuggingFace开放。开源加低价的组合拳,让开发者既能低成本调用API,也能自行部署微调。这种”API不赚钱就赚生态”的策略,正在重塑大模型的竞争格局。

定价权之争
GPT-5.6 Luna前脚宣布降价80%,V4-Flash后脚就上线公测,价格又低了一大截。有媒体直言”GPT-5.6的降价仿佛降了个寂寞”。
这背后是Token定价权的转移。OpenRouter平台的前五名已被中国模型包揽,底层逻辑就是激活参数占比决定的推理成本天花板。当4.6%的激活比就能逼近甚至超越100%激活的闭源旗舰时,高价模型的商业逻辑就站不住了。
Artificial Analysis的智能指数测试也印证了这一点:V4-Flash在最高推理档位拿下50分,而同类可比模型的中位数只有17分。
旧API迁移倒计时
DeepSeek同步宣布,旧版API(deepseek-chat和deepseek-reasoner)须在10月24日前完成迁移。V4-Pro正式版也将尽快发布。对于正在使用旧接口的开发者,迁移窗口已经打开。
从V4-Flash的表现来看,DeepSeek正在用后训练能力证明一件事:大模型竞争的下半场,比的不只是谁的参数多、谁的GPU多,更是谁的训练策略更聪明、谁的成本更低、谁的生态更开放。
堆参数的时代没有结束,但已经不是唯一的答案了。






