神秘模型“牛来”Ox Alpha横空出世:代码实测超GPT-5,全网都在猜它是谁

AI资讯21秒前发布 EdgeClaw
0 00

一只代号Ox Alpha的匿名大模型,这两天把开发者社区搅得沸沸扬扬。国内网友根据”Ox”的中文含义,给它起了个接地气的名字:”牛来”。这款来路不明的模型不仅代码实测表现超GPT-5,还把”猜身份”变成了一场全民游戏——全网都在赌它到底是谁家的。

上线即爆:百万token、限时免费、能看视频

8月20日,”牛来”正式上线AI聚合平台OpenRouter,随后迅速蹿红。官方信息显示,它拥有约104.8万token的上下文窗口,最大输出长度达13.1万token,支持文本、图像和视频输入,主打编码、长时间智能体任务和生产级复杂推理,目前处于限时免费开放状态。

开源终端编程智能体OpenCode当天就同步宣布接入,为其提供每天100万亿token的调用容量。一个”来历不明”的模型能有这种待遇,本身就说明圈内对它实力的认可。

代码实测:80%通过率,超GPT-5

真正让它火起来的,是硬碰硬的代码测试。独立研究员Ben Davis从软件工程基准DeepSWE中抽取10项任务进行实测,”牛来”完成了其中8项,通过率达到80%。同一测试集里,Claude Fable 5的通过率是65%,GLM-5.3 Max和Grok 4.6 xhigh都是62%,GPT-5.6 Sol Max只有52%。

发光公牛剪影立于二进制代码雨中,金色光粒环绕,象征神秘匿名大模型牛来Ox Alpha的身份悬念

DeepSWE的测试场景很苛刻:模型需要直接阅读真实代码仓库,定位问题、修改代码、运行测试,再根据报错继续修复,比常规单轮编程题更接近编码Agent的实际工作。虽然10项任务的样本偏小,后续开发者在另一个子集上测出约63%的通过率,但两次结果都说明,”牛来”的长程编码潜力已经逼近甚至部分超越头部模型。

全网猜身份:线索全指向智谱GLM-5.x

上线至今,”牛来”的真实归属才是社区最关注的话题。这次开发者不靠回答风格猜,而是用分词器指纹、视觉编码器消耗等技术特征做交叉验证。结果高度一致地指向一个方向:智谱尚未发布的GLM-5.x系列。

证据链相当硬:测试25组不同提示词后,”牛来”与GLM-5.3的token数量始终保持固定75的差值,说明两者共享同一份词汇表和切分策略;输入四段不同帧率、时长的视频,它的视觉token消耗与智谱GLM-5V-Turbo完全一致;它完全拒绝处理音频输入,与GLM-5V的路由方式一致。

放大镜投射发光全息问号,深蓝科技背景环绕神经网络与代码,象征全网对匿名模型牛来身份的猜测

细节上也很像:每千字符约出现1.3个emoji,处理单个DeepSWE任务平均执行117个智能体步骤,都与GLM系列的典型表现几乎吻合。Ben Davis直接放话:99%确定这就是GLM-5.x。

更关键的是,智谱有匿名测试的先例——2026年2月以Pony Alpha代号上线的匿名模型,后来被正式确认为GLM-5。小米MiMo的官方员工也已出面辟谣,谷歌Gemini的分词器与输出风格则完全不匹配。

匿名测试为什么流行:挂马甲是门生意

“牛来”事件背后,是大模型圈越来越流行的”挂马甲”玩法。在Arena里隐藏厂商和型号,可以尽量削弱品牌带来的先入为主,用户只能根据实际输出选择,积累的对战结果更接近真实体验。OpenRouter上,开发者会把匿名模型接进编码Agent,丢进真实仓库连续调用工具几小时,上下文稳定性和可靠性在高强度使用中迅速暴露。

蓝紫能量球在代码网格竞技场对峙,上升趋势箭头与光效环绕,象征牛来大模型实力对决与测评

对厂商来说,这等于一次免费的公测加营销。身份悬念能拉长讨论周期,让热度持续发酵,还能在正式发布前积累口碑。参照此前几款中国团队匿名模型的上线节奏,”牛来”的免费测试窗口大概率在8月27日结束,真实身份也临近揭晓。

一个Flash级别的匿名模型代码能力已经逼近头部,那资源投入更高的完整版又会把上限推到哪?答案最快下周就有分晓。

© 版权声明

相关文章