过去一周,全球AI开发者都在追问同一个问题:突然空降OpenRouter、登顶调用量榜首的匿名模型Ox Alpha,到底来自哪家实验室?2026年8月26日晚,谜底揭晓——智谱正式确认,它就是最新发布的GLM-5.3-Flash。这个被中文社区昵称为”牛来”的神秘模型,凭硬实力拿下双平台调用量新高,且全部流量由国产AI芯片集群承载。
一场完美的”匿名测试”
Ox Alpha自8月20日以匿名身份上线OpenRouter,没有发布会、没有预告,却在首日登顶调用量榜首,刷新单日用量历史纪录。凭借百万Token超长上下文、惊人的代码与Agent能力,全球开发者自发成为”自来水”。智谱用这场匿名的市场测试,让模型纯粹以技术实力赢得认可,也验证了”产品先行、品牌后至”的打法。

320B总参仅激活18B:Flash的底气
GLM-5.3-Flash是GLM-5系列首个原生多模态模型,总参数量3200亿,但每次处理Token仅激活约180亿参数。相比GLM-4.5系列,激活参数从320亿降至180亿、层数从92层减至45层,以更少计算资源保留接近大模型的完整能力。
在权威的Artificial Analysis Intelligence综合智能指数中,它取得57分,与Claude Opus 4.8持平,全面超越参数量高出一倍的GLM-5.2,定价却仅为后者的十分之一。
混合注意力架构与视觉Coding
为支撑百万Token长上下文,GLM-5.3-Flash采用线性注意力与稀疏注意力结合的混合架构,并配合IndexPool加权池化压缩索引缓存,注意力计算量降低3.01倍、KV Cache缩小4.44倍。

它还是首个把视觉能力原生融入编程循环的开源前沿模型:能够主动观察界面、渲染结果与交互反馈,持续测试并改进代码,在前端开发、游戏构建、Blender 3D场景中完成”写代码—运行—看结果—再修改”的闭环。
国产芯片集群独挑大梁
最受关注的是,GLM-5.3-Flash匿名测试期间的全部流量,均由部署在国产AI芯片上的大规模集群承载,通过自研高带宽互联网络连接。智谱披露,与同一硬件初始基线相比,端到端服务性能提升3倍,硬件效率与单Token成本已接近主流英伟达GPU水平。
这轮国产芯片的大规模实战检验,为行业吃下一颗定心丸:国产算力完全可以在真实生产流量中高效支撑前沿模型推理。








