DeepSeek V4.1 Flash发布:5520亿参数非对称架构反超自家旗舰,缓存输入降价60%

AI资讯1天前发布 EdgeClaw
1 00

DeepSeek又把自家旗舰”斩”于马下。9月10日,深度求索正式发布V4.1 Flash模型——一个定位”轻量高速”的Flash档新成员,却在官方基准测试中全面超越了上一代旗舰V4 Pro,同时API价格再下探,缓存命中输入价直接砍掉六成。更干脆的是,V4 Pro将在9月14日12时停止独立服务,原有请求全部转给新Flash、按Flash价格计费。

5520亿参数,输入输出”两套预算”

V4.1 Flash是DeepSeek全新模型结构系列里尺寸最小的一款,总参数量552B(5520亿),属于混合专家模型(MoE)。它换掉了传统自回归模型”一套权重同时负责读和写”的老路,改用全新的Causal-Encoder-Decoder(因果编码器—解码器)结构。

DeepSeek V4.1 Flash输入输出非对称架构的AI芯片概念图

这套结构最大的特点是输入与输出不对称:处理输入时每个Token只激活80亿参数,生成输出时激活160亿参数。模型整体很大,但每次计算只调用其中一小部分,并且给”读信息”和”写内容”分配了不同规模的算力。官方称其成本显著低于已知的同尺寸模型。

为什么要这么拆?因为智能体(Agent)类任务的Token消耗极度倾斜——一次调用里,读入的代码仓库、工具返回、历史对话可能有几万到几十万Token,而模型真正输出的判断或代码往往只有几十上百个Token,输入输出比动辄100:1。既然绝大部分计算花在”读”上,就没必要让读取环节背上和生成一样重的参数。

多项基准反超旗舰,视觉能力并入主力模型

新架构配合全新预训练方式和更大规模的强化学习后训练,让这个”最小号”模型跑出了旗舰级成绩。官方公布的数据中,V4.1 Flash在科学问答GPQA Diamond得分90.9,Codeforces竞赛编程评级3471,MathArena Apex得分65.6;终端任务执行Terminal-Bench 2.1得分90.6,网络安全CyberGym得分88.1,均高于V4 Pro此前公布的87.9和83.3。

KV Cache缓存压缩使显存占用降至四分之一的可视化示意图

另一项关键变化是原生多模态。此前DeepSeek靠实验性质的V4 Flash Vision Exp提供视觉能力,需要单独模块;V4.1 Flash把图像理解直接并入主力模型,能描述图片、识别截图文字、分析图表,文字与图片处理走同一个API。模型支持100万Token上下文、最大384K输出,提供思考与非思考两种模式,思考强度分low、high、max三档。

缓存压缩到极致,连续干活更便宜

技术报告把核心工程主题直接写进标题:把KV Cache压缩推到极限。V4.1 Flash的全局KV Cache压到每Token 890字节,约为上一代V4 Flash的四分之一,相比初代DeepSeek模型缩小了437倍。这带来的直接收益是,对显存(HBM)的需求降到上一代的1/4,对SSD的需求降到1/8。

这对Agent场景意义重大。智能体连续工作时要反复读取历史对话和工具说明,缓存命中费用往往占账单大头,KV Cache一压缩,这部分开销随之大幅下降。社区实测输出速度可达每秒300到500个Token。

大模型API降价普惠开发者的芯片金色光效概念图

价格方面,新定价已于9月10日12时生效,沿用峰谷定价:闲时缓存命中输入每百万Token 0.02元、缓存未命中1元、输出4元,高峰时段翻倍。相比老款V4 Flash同时段,缓存命中输入降价60%,未命中输入降约33%,输出降约11%;并发上限也从V4 Pro的500提到2500。开发者把模型名改为deepseek-flash即可调用。

Flash”上位”,V4 Pro四天后退场

按照官方安排,9月14日12时之后,deepseek-v4-pro的请求会被自动路由到V4.1 Flash,并按Flash单价计费,直到未来更大的V4.1 Pro上线。换句话说,开发者不用改代码,就能用原来约三分之一的价格,跑到比旧旗舰更强的性能。模型权重也已在Hugging Face以MIT许可开源,附带51页技术报告。

这步棋的逻辑很清晰:不搞优惠券、不做社区运营,而是靠架构升级把”便宜”做成产品本身的属性。当一个5520亿参数、原生多模态、百万上下文的模型,闲时缓存命中价低到每百万Token两分钱,高端AI的调用门槛正在被国产开源阵营一再拉低——闭源巨头靠定价挖出来的护城河,也就没那么宽了。

© 版权声明

相关文章