9月17日,智谱创始人唐杰在社交平台转发了一篇技术博客,披露了GLM团队在递归自我改进(Recursive Self-Improvement,RSI)方向的首个工程化实践。这一次,优化GLM-5.3-Flash推理系统的主力,不只是基础设施工程师,还有一个由GLM-5.3驱动的基础设施智能体(Infra Agent)。
换句话说,GLM开始参与构建承载GLM运行的系统。这是国内大模型厂商第一次把”AI改AI”的闭环跑进生产环境,而不是停留在概念演示。
十万张国产芯片上,从零搭起生产级推理服务
这次落地的对象是GLM-5.3-Flash的线上推理系统,运行在超过十万张国产AI加速器组成的集群上,全部线上推理都承载其上。此前没有如此大规模的国产卡集群部署经验可以照搬。
团队要同时面对几道难题:国产芯片显存容量和互联带宽相对受限、新模型架构适配、100万Token长上下文支持、多模态请求处理,再加上软件生态仍在发展,部分算子支持不足,不少资料只能靠工程团队自己摸索。

在这些约束下,Infra Agent参与了推理系统的设计、调试与优化,帮助分析性能瓶颈、提出方案并完成部分底层代码修改。从模型首次跑在国产加速器上,到承载全部生产流量,整个过程只用了不到两周。
最终,端到端吞吐提升到初始基线的约3至3.2倍,硬件利用效率和单Token成本达到与主流英伟达GPU平台相当的水平,并支持1M上下文与多模态请求。
技术栈上,团队用了一系列激进的内存与调度优化:针对线性注意力和语言模型头的节点内张量并行、ReplaySSM以算力换显存、INT8/FP8/BF16混合精度缓存、W8A8量化、Layer Split,以及Encode-Prefill-Decode分离式架构,在算力、内存、通信和调度之间重新找平衡。
不只是写代码,而是跑通完整工程闭环
这次真正的变化,是智能体不再局限于生成代码,而是围绕推理系统完成完整工程闭环:自主分析性能瓶颈、定位精度缺陷、修改底层代码、执行分层测试,再根据实验反馈持续迭代。
博客给出了三个具体案例。在上下文并行路径中,智能体发现不同上下文分片反复合并状态矩阵时,TF32计算的舍入误差会随序列变长而累积,最终影响长上下文精度,相关修复已合并进Flash Linear Attention项目。
在KV Transfer与DeepEP调度之间,它沿Python与C++调用链排查,发现节点内路径没有及时释放Python GIL,导致传输无法与调度有效重叠、部分场景额外开销超过30%;修改后开销降到1%以内。它还重构了一个Decode Kernel,把重复执行四次的归一化计算合并,拿到1.71倍性能提升。

唐杰提到,智能体遇到困难时,很少是因为写不出代码,而是无法判断”为什么结果变差”。为此团队构建了名为dense feedback的稠密反馈机制,把资深工程师看时间线、跑微基准、比对模块输出的经验,变成模型可快速获取、可被客观实验验证的反馈信号。
匿名上线6天吃掉62万亿Token,人类角色正在后移
这套系统已经接受真实流量检验。GLM-5.3-Flash曾以匿名模型”Ox-Alpha”在OpenCode和OpenRouter上线,一周内成为两个平台调用量最高的模型之一,6天处理Token超过62万亿。
横向看,RSI正成为头部实验室竞逐的下一个高地:Anthropic在6月披露Claude编写了其代码库八成以上的合入代码,OpenAI也在9月初宣布达成”自动化研究实习生”里程碑。
需要客观看待的是,智谱在博客中明确强调,他们尚未实现真正意义上的RSI——目标设定、反馈环境搭建、高风险修改审核仍由人类工程师负责,距离AI完全自主设计并训练自己的继任者还很远。工程师的角色,正从亲手解决每个问题,转向设计让AI能够自我纠错的反馈系统。
“模型优化系统,系统承载模型。”当大模型竞争越过参数规模和榜单分数,研发效率本身开始成为比拼对象。谁先让模型参与构建下一代模型,谁的迭代速度就可能获得复利式增长——这对国产模型追赶和整个算力产业链,都是一个值得关注的边际变化。








