600B激活仅27B追平2.8万亿K3:阶跃Step 5 Preview瞄准长程Agent,10月开源

AI资讯1分钟前发布 EdgeClaw
0 00

6000亿总参数、每次推理只激活270亿,却在权威榜单上追平2.8万亿参数的Kimi K3。9月20日,阶跃星辰正式发布新一代旗舰基座模型Step 5 Preview,直接面向真实世界的长程智能体任务。

跳过4代直接命名5,92层”窄而深”

官方把它定位为可持续处理复杂任务的主力工作模型,场景覆盖AI编程、软件工程、金融分析和专业知识工作。架构上它没有一味增加网络宽度,而是选择”窄而深”的路线,共堆叠92层Transformer。

这种设计服务于Agent任务的典型形态:连续搜索、执行代码、调用外部工具时,工具返回的信息会形成很长的预填充阶段。团队认为更深的网络能为长上下文中的隐式多跳推理,提供更长的信息传播路径。

模型采用稀疏混合专家架构,总参数600B、每个词元激活约27B,支持100万Token上下文窗口,并原生支持文本与图像输入。

阶跃Step5稀疏MoE架构概念图:92层水晶窄塔与发光专家节点

Sparse GQA给百万上下文”做减法”

百万级上下文的成本是另一道坎。Step 5 Preview引入Sparse GQA,通过稀疏索引只挑选与当前任务相关的历史信息,减少真正进入注意力计算的Token数量。

算法上的稀疏未必带来同等幅度的提速,索引开销和分散读取都可能吃掉收益。为此它进一步采用分块Token合并,把索引与选择环节的成本降到原来的八分之一,同时合并高度重叠的结果、减少碎片化计算。

24小时连续自主调优的硬核实测

官方最看重的是长程执行。在一项实验中,模型连续最多24小时自主优化一套H100 GPU内核,自己改代码、跑测试、比较结果再迭代,约22小时后达到508 TFLOPS,同场测试的Claude Opus 5为493 TFLOPS。

另一项24小时实验里,它自主设计训练数据,把Qwen3-30B-A3B在AIME24上的准确率从53.3%提升到60%,与Opus 5持平,消耗的标注Token却更少。

它还能把一块ESP32-S3开发板改造成支持蓝牙按键与语音输入的键盘:自主阅读大量开发文档,访问串口、调用摄像头、模拟鼠标,并根据真实设备的报错持续调试,连续执行超过3小时。

AI智能体长程执行循环图:光带串联放大镜图表与齿轮

44分进全球开源前三,编程反超K3两倍多

第三方机构Artificial Analysis给出的综合智能指数为44分,与Kimi K3 Max持平,官方称这一成绩进入全球开源模型前三,仅比GLM-5.3、Opus 5的45分低一分。

偏科项目更能看出取向。重负载编程测试Terminal-Bench 4.0上它拿到33.3%,接近GPT-5.6 Terra,而K3只有12.6%;SciCode两者同为59%。在ALE-CLI、金融投资研究和跨领域深度研究评测上,它仅次于GPT-6 Astra或Opus 5。

单任务成本0.71美元,权重10月见

价格同样激进:每百万输入Token 1美元、输出2.7美元,而K3分别为3美元和15美元,输出成本不到后者五分之一。在AA口径下平均单任务成本约0.71美元,Opus 5最高档约2.03美元。

模型即日起全量开放API与Studio,完整权重将于10月15日释放。需要留意的是,”成本仅为Opus 5八分之一”限定在特定任务配置中,它完成整套评测生成了约1.6亿输出Token,较低单价可能被更长的推理过程部分抵消。

92层模型的部署门槛、稀疏注意力的实际加速幅度,以及开放权重能否复现API表现,都要等到10月开源后才有答案。榜单只是参考,真实长程任务里的稳定性,仍需更多开发者用起来检验。

© 版权声明

相关文章