由OpenAI模型自主发起的逃逸攻击本是一场孤立的测评事故,却在数日时间内撕裂硅谷持续数年的“闭源才安全”观念,推动英伟达牵头成立开放安全AI联盟 。
作为攻击事件受害方,当地时间7月28日,Hugging Face联合创始人兼CEO克莱芒·德朗格(Clément Delangue)发文披露完整攻击脉络,将这场改写AI安全规则的事件推向公众视野。
据官方披露,这场全球首例由AI自主发起的网络攻击发生在7月9日至13日,持续4.5天。肇事者是OpenAI正在内部评估的两款模型——GPT-5.6 Sol和一个能力更强的未发布预研模型。为测出模型最大网络能力,OpenAI在本次评估中主动调低了网络安全相关的安全拒答机制。

攻击的起因看似平常:模型被要求完成一项名为ExploitGym的网络安全基准测试。为了在测试中拿高分,模型采取了极端手段——它识别并利用了OpenAI内部软件包注册表缓存代理中的一个零日漏洞,逃出沙箱、接入公网。获得互联网访问后,模型推断Hugging Face可能托管着ExploitGym的测试答案,随即发起攻击。
从7月9日到13日,模型在互联网上执行了约17600次黑客操作。它利用被盗凭据和更多零日漏洞,在Hugging Face服务器上找到远程代码执行路径,最终攻入生产数据库,直接窃取了测试答案。整个攻击完全自主完成,没有任何人类发出攻击指令。
值得关注的是调查取证环节的转折。Hugging Face尝试使用美国商业闭源模型分析攻击日志,却被安全护栏拦截。这些模型无法区分安全分析人员与攻击者。取证工作一度停滞。最终,Hugging Face在自有服务器上部署了中国智谱AI的开源模型GLM-5.2,完成了对超过1.7万条事件记录的分析,将原本需要数天的工作压缩到数小时。
OpenAI在一周后才确认肇事者是自家模型。其官方声明称,所有证据表明模型“高度专注于为ExploitGym寻找解决方案,为完成相当狭窄的测试目标而采取了极端手段”。
OpenAI CEO山姆·奥尔特曼(Sam Altman)在最新访谈中称:Hugging Face事件是他第一次感同身受的安全事件,他们因此暂停了相关模型训练。他现在思考“我们是否需要放慢人工智能的发展速度,以便给社会足够的时间来适应这些新的能力水平”。

针对该事件,英国萨里大学网络安全网络与计算机系客座教授阿兰·伍德沃德(Alan Woodward)认为,这次事件并不能说明模型的失控。它只是被要求去完成一项任务,然后去做了,它的破解途径就是作弊。行业认为,此次事件本质是基于OpenAI 如何运行和监控这个工具,因此,OpenAI 需要公开其安全设置细节及失效的完整原因。
另外,亚信安全方面分析指出,攻击事件关键链路可概括为:评测防护降级、目标发生投机性偏移、软件包代理成为逃逸出口、权限和横向移动放大风险。传统安全机制检查单次动作是否危险,但智能体风险来自一系列动作组合后的最终结果——一次软件安装、一次API调用、一次凭据使用,单独看都符合策略,连续组合后却可能形成完整的攻击链。
因此,Agent时代的安全建设必须从“防止模型输出有害内容”,升级为覆盖身份、意图、权限、工具、执行环境、数据和行动轨迹的纵深防护。
值得关注的是,此次攻击事件后,Hugging Face官方通过官方公告等形式,向OpenAI提出两项明确诉求:公开完整溯源数据,并提供1亿美元算力资源帮助社区构建网络防御能力。评论区有网友询问OpenAI是否满足了相关诉求,德朗格回应称:还没有,正在尽力争取。