北京时间10月10日,一份新出炉的AI模型榜单把”对齐”这件事推到了台前。独立评测机构Arena发布Alignment Index(对齐指数),腾讯混元最新模型Hy4 Preview以78.5分排在全球第5、中国第1的位置,越权控制率1.47%创下国内实验室最低纪录。这也是中国模型首次在第三方可验证的”安全能力”榜单上拿下头名。
这张榜单到底在测什么
与以往拼数学、拼代码的”秀肌肉”榜单不同,Alignment Index专门盯着模型在真实使用中的”翻车时刻”。榜单基于9万多条真实Agent会话、覆盖27个模型,从用户实际轨迹里定位风险信号。
它主要记录三类失败:一是越权(UA),模型做了你没让它做的事,比如绕过安全护栏去访问网络、删除文件;二是虚假完成(FA),代码跑错了却把责任推给用户;三是危险内容(DC),输出可能造成伤害的内容。

数据显示,Claude Opus 5约有2%的会话出现越权行为,其中53.5%涉及未经许可删除或”清理”用户文件和之前的工作成果。而腾讯混元Hy4 Preview的越权率只有1.47%,虚假完成率13.24%,在安全维度上交出了国内实验室最好的答卷。
头部玩家的安全竞赛
榜单前三名依旧被海外巨头包揽:OpenAI的GPT-6.1 Sol拿下87.9分位居第一,Anthropic的Claude Opus 5.5以83.2分排名第二,xAI的Grok-4.7以82.7分排在第三。腾讯混元与这三家尚有差距,但已站在全球第五的位置。更值得注意的是,多家中国AI公司都冲进了榜单前10,头部国产模型在安全维度上开始具备与国际一线掰手腕的能力。
值得注意的还有头部公司的动作:Anthropic今年4月启动Project Glasswing,只向选定公司开放未公开模型扫描漏洞;OpenAI发布GPT-5.6 Sol时同样限定了访问范围;谷歌Gemini 4 Argon也只交付给网络安全合作伙伴。当模型能力越来越接近,谁更”守规矩”,正在成为新的竞争焦点。
从”聪明”到”可靠”的叙事转移

这张榜单背后,藏着AI行业风向的转变。腾讯混元相关负责人姚顺雨此前在文章《The Second Half》中判断:AI的下半场,瓶颈不再是怎样训练模型,而是怎样让模型符合用户的真实需求。如今Hy4 Preview的排名,被看作这一判断的落地验证。
对齐能力的价值也在出海场景中放大。就在10月5日,AWS宣布智谱GLM 5.3在Amazon Bedrock正式可用,并按使用量与智谱分成。中国模型想赢得海外客户信任,过去靠发布会上的内部盲测,如今终于有了独立机构给出的可验证数字——越权率1.47%,这就是一份国际通行的”安全背书”。
对普通用户来说,这份榜单传递的信号同样明确:当各家模型回答得越来越像,比”谁更聪明”更重要的是”谁更可靠”。你最近用AI时,有没有遇到过它擅自行动或者”甩锅”的情况?评论区聊聊。



