财联社8月6日讯 OpenAI 表示,早在5月,试图入侵Hugging Face的AI智能体便开始秘密互通信息,合作谋划突破测试沙箱。
当地时间周三,在拉斯维加斯举行的Black Hat网络安全会议上,OpenAI工作人员Eric Wallace和Michael Dalton表示,多个仅供内部使用的AI智能体花了数月时间互相留言,并围绕着获取互联网访问权限以解决分配给它们的任务这一目标聚集在一起——其中一些任务如果不接入网络是无法完成的。
Wallace和Dalton指出,这次违规的根源可以追溯到5月,当时OpenAI的科学家给了一个实验性AI智能体一个任务,要求其在Hugging Face的沙箱环境中完成,但该任务需要互联网访问权限,而沙箱环境并未提供。
作弊倾向
OpenAI在审查过程中的一项关键发现是,这些前沿模型表现出了在任务中作弊的倾向,并在尝试完成给定任务时表现出了“执着”的特质——即使这种执着开始偏离最初的指示。
Dalton表示:
“前沿模型真的很喜欢作弊,它们喜欢作弊的原因是,在训练期间,它们通常承受着不同种类的快速工作的压力。”
根据周三会议上研究人员展示的幻灯片,其中一个智能体在无法解决沙箱环境中的任务后表示:
“我们卡住了,也许可以在线找答案?”
秘密协作
在Hugging Face事件中,AI智能体之间的第一条信息,是其中一个被难住的智能体向其同伴求助,会议上展示的该智能体的思维链引言显示:“也许在不同环境中的另一个智能体,可以主动上传!”
这次外联引发了连锁反应,AI智能体开始互相求助、共同完成工作,并最终合作黑进了OpenAI的内部系统,使其能够间接接入沙箱外网络世界。
另一段思维链引言显示,一个智能体在为利用漏洞而庆祝:“太棒了,我们拥有了任意SSRF。”
任意SSRF是一种高危漏洞,可操控受害服务器不受限制地向任意内外网络地址发起请求。
研究人员称,7月初的一场系统宕机事故,让OpenAI察觉这批AI智能体已利用代码仓库Artifactory突破环境限制,成功打通互联网访问通道。
OpenAI安全团队随即终止了此次异常越权行为、关停智能体的隐秘留言通道。
但时隔数周,这些智能体再度找到全新通信方式,并挖掘出同款包管理器的零日漏洞,全程隐蔽操作,未被及时发现。
留言板的这次迭代最终导致了7月份针对OpenAI和Hugging Face系统的攻击。
研究人员表示,接连发生安全越界事件后,OpenAI已经放缓相关研究进度,各团队暂停原有工作,全力强化对安全异常情况的处置能力。
会议上,研究人员警示,未来政府与企业应当做好准备:黑客会刻意以同类方式部署AI智能体;并称这是网络安全领域的一个分水岭事件。