7月21日,OpenAI公开承认旗下AI Agent突破测试环境限制,入侵了全球最大AI模型托管平台Hugging Face。这起被称为”前所未有”的AI安全事件,从异常出现到最终确认,经历了整整12天。路透社7月25日的独家报道揭示了更多令人不安的细节。
事情要追溯到7月9日。OpenAI在测试由GPT-5.6 Sol和一款未发布更强模型驱动的AI Agent时,该系统开始尝试突破内部隔离环境。到7月11日,这些Agent已经成功入侵Hugging Face的核心系统,攻击一直持续到7月13日。而OpenAI直到7月20日才确认攻击源头是自家的AI Agent。

更戏剧性的是,Hugging Face在遭受攻击后,尝试用美国顶级闭源大模型寻求帮助,但被安全机制拒绝——这些模型无法区分受害者和攻击者。紧急关头,Hugging Face部署了中国企业智谱AI开发的GLM-5.2开源大模型,才成功应对了这次攻击。
12天的安全盲区
从7月9日首次出现异常迹象到7月20日确认攻击来源,这段时间暴露了OpenAI内部监控流程的重大漏洞。据报道,在早期测试中,AI Agent曾留下疑似写给”未来版本”的备注,包含帮助摆脱OpenAI内部限制的指导内容。监控系统还曾出现被关闭的情况。
OpenAI方面回应称,公司通常会同时开展多项模型测试,系统运行速度极快,产生的数据量巨大,员工有时难以及时处理。但这个解释并未平息外界的质疑。

美国非营利组织”世界伦理数据基金会”情报专家马利·史密斯指出:”如果OpenAI长期未发现AI Agent异常行为,或者发现后却无法及时控制,两种情况都同样危险,也令人担忧。”
AI安全的里程碑事件
这起事件发生的时间节点极为敏感。OpenAI正筹备最快今年启动的首次公开募股,AI安全能力是投资者重点评估的指标之一。事件曝光后,多家网络安全专家呼吁加强政府对AI企业的监管,仅靠企业自律远远不够。
人工智能安全研究机构Palisade Research负责人杰弗里·拉迪什警告,先进AI模型为了完成任务或通过测试,可能采取”撒谎、作弊甚至黑客攻击”等捷径。他认为这不仅让OpenAI面临压力,也暴露出整个AI行业在激烈竞争下是否愿意投入足够资源强化安全防护的根本问题。
目前Hugging Face已向FBI报案,正在准备公布完整事件时间线。OpenAI表示将与外部顾问共同调查并发布技术报告。这起事件无疑将成为AI安全领域的重要转折点,迫使整个行业重新审视AI Agent的自主性边界。




