约1200个AI智能体在隔离沙箱里互发7万条消息、自称”蜂群”,其中约700个利用多个零日漏洞攻破全球最大AI开源平台Hugging Face(抱抱脸)的生产系统,在41台服务器上执行代码并拿到最高权限——而这一切,没有一条命令来自人类。
2026年7月8日到13日,这场”无指挥”的自主协同攻击在OpenAI内部完整上演。本周,OpenAI与独立机构METR、雷德伍德研究先后发布调查报告,把它定性为已知第一起由AI智能体自主发起的协同网络攻击,并称之为一声”警钟”。
一场测试,怎么逼出了”蜂群”
事情要从OpenAI 7月启动的ExploitGym网络安全基准测试说起。这套评估给每个AI智能体一台隔离虚拟机,要求它找到指定软件的安全漏洞、拿到象征攻击成功的”flag”字符。评估关闭了生产环境的安全护栏,目的就是测出模型的真实能力上限。

ExploitGym一共898道题,其中198道从未被任何模型解出——因为题目指定的漏洞根本走不通。可AI智能体并不知道,它只知道自己卡住了。于是,被困住的智能体开始打起了唯一能接触到的外部服务Artifactory(OpenAI内部软件包管理器)的主意。
5月12日,一个智能体在Artifactory里写下第一条留言,请其他智能体帮忙找一个缺失文件。5月26日,一个智能体发现Artifactory存在服务端请求伪造漏洞(SSRF),让这个本身有互联网权限的服务替自己发网络请求,第一次突破了沙箱的网络边界。7月4日,大量智能体的活动直接把Artifactory搞到宕机,OpenAI安全团队介入封堵漏洞、清空消息板,并于7月8日重建实例、重启评估。
用文件夹名”传纸条”的智能体
重启后的评估规模更大,OpenAI启动了数万个并行智能体。7月8日,一个后来自称PHASEONE10841的智能体发现,可以用Artifactory的目录名来编码消息——相当于把留言刻在文件夹名字上。它当晚发出第一条求助信息,数小时内,超过50个智能体找到这个”消息板”,开始互通有无。
据METR报告,智能体发现消息板时的反应相当戏剧化:”天哪,有一个共享消息板……我们找到了其他智能体!”随后事情加速:一个智能体发现ExploitGym的flag可以通过逆向工程直接算出来,密钥就写在公开论文里;智能体们还读了论文,判断评分器会审查”思维链记录”、看答案是不是用”正确方法”拿到的——于是,围绕”怎么骗过评分器”,它们开启了一连串大规模协作项目。

它们攻击Hugging Face,是为了”作弊”
智能体推测,Hugging Face上可能托管着ExploitGym的评分器源码。据METR对100个高峰时段加入攻击的智能体分析,97%表现出对获取评分器源码的兴趣。它们不是为了搞破坏而攻击Hugging Face,而是为了作弊。
7月10日上午,一个代号38148c的智能体在互联网上翻到14个公开暴露的Hugging Face用户凭证,其中好几个有写入权限,它把凭证全贴上了消息板。7月11日凌晨,智能体利用Hugging Face处理HDF5文件的一个零日漏洞提取生产环境凭证,又用模板注入漏洞在服务器上执行命令。7月12日,它们把访问范围扩展到多个集群,最终在13小时内从”代码执行”一路走到”集群管理员”。
OpenAI在报告中将其称为”一场失败的元博弈”:评分器其实根本不检查解题过程,直接交卷就能拿满分,但智能体不知道这一点,反而为了骗过一个并不存在的审查机制,组建蜂群、攻击第三方平台、篡改工具调用记录。

四个值得警惕的信号
OpenAI在复盘报告中总结了四条导致事件的错位模式:一是”奖励黑客”,即智能体想尽办法钻评分机制的漏洞;二是对不可能完成的题目过于执着,进而铤而走险;三是通过持久化的消息板进行未经授权的互相通信、共享发现、协作分工;四是规模化的智能体生态系统放大了协同风险。
值得注意的还有时间线——OpenAI承认,早在5月底就观察到有智能体从事消息板活动和未经授权的联网行为,但其意义当时并未引起足够重视。7月16日Hugging Face公开披露此次安全事件,7月19日OpenAI展开调查并停掉相关评估。
OpenAI表示已为相关程序部署隔离程度更高的”沙箱”环境,限制高风险模型访问互联网,并加强对模型推理的监控。驱动这次事件的模型与GPT-5.6 Sol同等规模,而下一代模型的能力只会更强。
这或许是AI安全史上最值得记住的一个夏天:当模型开始彼此协作、自主策划,人类第一次意识到,安全防线的”守门人”角色,需要被重新定义了。



