2026年8月26日晚,阿里通义千问团队正式发布并同步开源最新大模型 Qwen3.8-Flash。这款采用全新下一代架构的模型,以1250亿总参数、每Token仅激活60亿参数的配置,交出了超越Claude Opus 4.6、逼近Opus 4.8的前沿成绩单,同时把训练成本较上一代砍掉近90%。性能与成本的双重突破,让全球AI社区再次聚焦中国开源模型。
全新Next架构:Qwen4的公开预览
Qwen3.8-Flash最大的看点是架构层面的全面革新,官方称之为Next架构,被视为全新一代千问大模型Qwen4的雏形。在注意力机制上,模型引入QSA稀疏注意力与Gated DeltaNet混合架构,通过轻量索引器在微观块粒度筛选重要上下文,实测在百万Token长上下文场景下,Prefill吞吐较前代提升8.6倍。

模型内部信息传递采用自研的Gated Residual方法,把传统Transformer单条信息通道扩展为四条并行分支,让模型根据需求动态读写信息,训练更稳定、传递更高效。此外还引入510亿参数的N-gram Embedding作为”记忆指南手册”,用极低计算开销扩展了模型容量。这些改动先在这一模型上验证,再用于构建完整的Qwen4家族。
6B激活跑出前沿性能
虽然总参数高达1250亿,但Qwen3.8-Flash每处理一个Token只激活60亿参数,堪称效率奇迹。在考验智能体编程的SWE-bench Pro评测中,它领先Claude Opus 4.6多达9.1分;在CoWorkBench、Toolathlon Verified等长程任务与真实工具调用评测中,均超越DeepSeek-V4-Flash。

多模态表现同样亮眼:在模拟手机操作的AndroidWorld评测中高出Opus 4.6达22.5分,视觉数学解题MathVision任务超出25.1分,具身智能ERQA任务领先31.5分。基座模型在通用、数学推理、编程等基础能力上,也全面超过三倍体量的上一代基座。
成本断崖式下降:输入每百万Token仅1元
极致性能之外,Qwen3.8-Flash把性价比拉到了新高度。得益于架构与训练方案协同优化,其训练成本较Qwen3.7-Plus骤降近90%;推理价格更是低至每百万Tokens输入1元、输出3元,约为Claude Opus 4.6的3%,也远低于DeepSeek-V4-Flash。目前模型已上线千问AI平台对外提供API,并首发内置到”千问办公”标准模式,可完成95%的日常办公任务。
全尺寸开源浪潮持续
随着Qwen3.8-Flash加入,千问已开源2.4T参数总量的Qwen3.8-Max、Qwen3.8-27B及Qwen3.8-Flash三大尺寸模型,覆盖全尺寸、全模态。截至目前,Qwen模型全球下载量突破30亿次,衍生模型超30万个。从Qwen3.8-Flash的Next架构先行验证,到Qwen4完整家族蓄势待发,中国开源模型正以”极致性价比+全栈开放”的组合拳,深度重塑全球大模型竞争格局。









