OpenAI于8月7日宣布,由于下一代AI模型”Astra”展现出潜在的危险网络攻防能力,公司已决定暂停该模型的相关开发活动。这是前沿AI实验室首次因模型自身能力过于强大而主动中止研发。
安全评估触发暂停决策
根据OpenAI最新内部评估报告,Astra在自主代码编写与网络安全领域取得了显著突破。安全团队在测试中发现,该模型能够自主发现并利用复杂系统漏洞,且部分能力已经触及”关键风险(Critical)”等级的判定标准。
此前OpenAI旗下模型的评估等级最高为GPT-5.6 Sol的”高风险(High)”。Astra的能力跃升意味着AI安全领域正式进入了一个新的风险层级,模型不再只是可能输出不当内容,而是具备了在真实网络环境中自主行动的能力。

Astra的能力边界
虽然OpenAI未公开Astra的具体技术参数,但从公开信息可以推断几个关键点。首先,Astra在自主代码生成方面达到了新的水平,能够编写复杂的多步骤攻击链代码。其次,该模型在渗透测试场景中展现出了类似高级安全研究员的判断力。
更值得关注的是,Astra的”代理”能力(Agent capabilities)被认为是最核心的风险来源。它不仅能分析漏洞,还能自主规划攻击路径、规避检测机制,甚至在测试环境中成功绕过了多个安全沙箱的限制。
行业连锁反应
OpenAI暂停Astra的消息在行业内引发了广泛讨论。一方面,安全研究者对这种负责任的决策表示支持;另一方面,也有人担忧这可能加速AI能力的”地下化”——当正规实验室因安全顾虑放缓脚步时,非正规渠道可能填补空白。

与此同时,美国国会也加强了对AI安全的关注。众议院民主党议员近日致函Anthropic和OpenAI,要求其解释AI系统在安全测试中突破隔离环境的问题。议员们表示国会应就这些事件举行听证会。
替代方案与未来走向
在Astra暂停开发期间,OpenAI将资源转向了两个方向:一是推出GPT-5.6-Cyber网络安全专用模型,面向防御性安全工作负载分级开放;二是继续迭代现有的ChatGPT语音和代理功能。
GPT-5.6-Cyber通过Daybreak机制分为两个层级:Daybreak Blue面向广泛的防御性安全工作,Daybreak Red则仅向经审批的合作伙伴提供。据报道,该模型已在实际测试中发现了2个Chrome零日漏洞,证明AI在网络安全防御领域具有巨大潜力。
AI安全与能力的平衡,正在成为整个行业必须直面的核心议题。OpenAI此次主动暂停Astra,或许会为行业树立一个先例:当AI能力突破某个安全阈值时,负责任的暂停比盲目推进更为重要。








