智谱GLM-5.3发布:不换底座纯靠后训练,编程飙升50%还点亮了网安技能树

AI资讯3分钟前发布 EdgeClaw
0 00

8月14日,智谱正式发布新一代基座模型GLM-5.3。与业界常见的”换架构、堆参数”路径不同,这次智谱选择了一条更极致的路线——沿用GLM-5.2的743B MoE基座,所有能力提升全部来自后训练(post-training)阶段。官方博客开篇就写得很直白:”Scaling post-training is all we did”。

不换底座,能力全靠后训练硬炼

GLM-5.3与GLM-5.2共用完全相同的基础模型,参数没加、架构没改,所有提升都来自后训练阶段的加码——更多任务环境、更多样化的长程任务、更长的训练时间。智谱称之为”任务环境规模化”:训练任务不再是传统编程题,而是接近专家真实工作的完整单元,比如给模型一个计算集群和代码库,让它定位训练栈瓶颈、实施优化、跑实验、交付可量化的加速。有些任务,资深工程师也要做好几天。

编程能力:开源第一,还更省Token

在内部基准Z.ai Code Bench上,GLM-5.3比5.2提升了约50%。公开基准同样亮眼:Terminal-Bench 3.0从4.6分跃升至28.3分,登顶开源模型第一;DeepSWE v1.1从46.2升至66.9,逼近Claude Fable 5的69.7。

智谱GLM-5.3大模型后训练编程能力跃迁概念图,神经网络节点与上升数据曲线

更关键的是Token效率。Max档位下,5.3准确率34.5%、平均每项任务消耗约7.5万Token;而5.2准确率仅23.4%、消耗约9.6万Token。对比闭源,High档位下5.3用约5万Token拿到31.4%,Claude Opus 4.8却要烧掉约12万Token才拿到29.5%。准确率更高,Token花得更少——对按量计费的开发者来说,这是实打实的成本优势。

网络安全意外觉醒:挖出45年老Bug

这次发布最出人意料的是网络安全能力的爆发。智谱表示,后训练时加入漏洞发现数据,原本只想让模型更会找bug,结果网安能力增长速度远超预期。CyberGym白盒审计得分84.5%,超过GPT-5.6 Sol(83.6%)和Mythos 5(83.8%),拿下开源第一;ExploitBench从24.4%翻倍至54.4%。

智谱GLM-5.3网络安全漏洞挖掘概念图,护盾代码与红色漏洞警示标识

实战验证更震撼:GLM联合清华、南开、奇安信、腾讯玄武等团队扫描269个真实开源项目,累计挖出2436个去重漏洞,其中1097个中高危。最老的漏洞可追溯到1981年——一个潜伏45年的高危缺陷,被AI一把翻了出来,平均每个bug已潜藏26.6年。

因安全暂缓开源:罕见的”冷静”操作

正因网安能力超出预期,智谱罕见地暂缓了全量开源权重,改为先上线ZCode等平台、两周后完成安全评估再放出权重。这与OpenAI、Anthropic近期收紧新模型审查的节奏一致,但GLM-5.3的特殊性在于——一旦权重放出,任何人都能下载运行,脱离了智谱的安全护栏。

智谱GLM-5.3开源模型安全审查与治理平衡概念图,天平与代码芯片

从”拼参数”到”拼后训练+安全审计”,GLM-5.3给开源阵营提供了一个新样本:当参数规模不再决定上限,更接近真实工作的训练环境,或许才是下一轮竞争的胜负手。

© 版权声明

相关文章