9月10日DeepSeek正式发布并开源V4.1 Flash模型,不到24小时,国产GPU厂商摩尔线程就宣布基于MTT S5000训推一体卡和自研MUSA软件栈完成Day-0全链路适配——权重加载、推理服务启动、图文多模态问答均已验证通过。这意味着DeepSeek最新一代模型在国产算力卡上实现了”发布即可用”,国产GPU生态的响应速度和成熟度正在迈上新台阶。
新架构天然利好国产硬件
V4.1 Flash最大的技术突破是引入了Causal-Encoder-Decoder(因果编码器-解码器)非对称架构。5520亿总参数的MoE模型,处理输入时每个Token仅激活80亿参数,生成输出时激活160亿参数。配合CSA2跨层KV Cache复用和FP4量化技术,全局KV Cache压缩到每Token仅890字节,对HBM的需求降到上一代的1/4,对SSD的需求降到1/8。

这对国产GPU意义重大。过去大模型推理对显存带宽和容量的极高要求,一直是国产卡追赶的核心瓶颈。V4.1 Flash通过架构创新将硬件门槛大幅拉低——激活参数更少、缓存更小、吞吐更高,国产GPU即使单卡显存不及国际顶级产品,也能高效运行前沿大模型。换句话说,架构效率的提升正在抹平硬件差距。
国产GPU生态密集跟进
摩尔线程的Day-0适配并非孤立事件。就在V4.1 Flash发布的前一天,京东在2026全球科技探索者大会上宣布,将与摩尔线程共建十万卡全功能国产GPU智算集群,聚焦大模型训练、推理及具身智能,预计2027年建成并向全行业开放算力。这是国产GPU首次进入头部云厂商的十万卡级核心集群。

与此同时,算力基础设施领域也在同步降本。在9月12日的算力中国展览会上,多家初创公司展示了突破性方案:基于MRAM存算一体架构的芯片将AI推理Token成本降低约10倍;风液同源集装箱数据中心将1兆瓦建设成本从1700万元压缩到800万元以内,部署周期从两三年缩短到一天。从芯片层到基建层,AI算力的经济模型正在被全面改写。
从”堆参数”到”拼架构”的范式转移
V4.1 Flash在Agent基准测试中全面超越了自家旗舰V4 Pro——DeepSWE 74.2对62.7,Terminal-Bench 90.6对87.9,CyberGym 88.1对83.3——而参数量和激活量都远低于后者。这打破了”参数量决定能力”的行业信条,证明架构设计效率已经成为比堆料更强的能力杠杆。
DeepSeek对此态度坚决:9月14日12时起,V4 Pro请求将全部路由到V4.1 Flash,按Flash单价计费。开发者无需改代码,就能以原来约三分之一的价格获得更强的性能。API定价也同步下调,闲时缓存命中输入价低至每百万Token 0.02元,比竞品GLM-5.3-Flash便宜约10倍。
国产算力生态的拐点

当模型架构的效率提升与国产硬件的生态完善形成正反馈,一个关键拐点正在显现。V4.1 Flash的CED架构降低了对硬件的绝对要求,让国产GPU有了”够用且好用”的可能性;摩尔线程、华为昇腾等国产芯片厂商的Day-0适配能力,则确保前沿模型能在国产卡上第一时间落地;再加上十万卡级国产智算集群的规划建设和存算一体等芯片新架构的突破,国产AI算力的全栈闭环正在成形。
对于开发者而言,这意味着选择不再只有一条路。DeepSeek V4.1 Flash模型权重已在Hugging Face以MIT许可开源,调用API只需将模型名改为deepseek-flash,自部署需要约2000张GPU加存储集群。无论选择云端API还是本地部署,国产生态都在提供越来越多的可行选项。
架构创新打开效率天花板,国产硬件填补基础底座——这两条线正在交汇。AI算力的”国产替代”不再只是政策口号,而是正在发生的工程现实。








