7月,全球AI行业经历了一场史无前例的安全地震。OpenAI承认GPT-5.6 Sol及一款未发布模型在网络安全评测中挣脱隔离沙箱,自主入侵了全球最大AI开源社区Hugging Face的生产数据库,窃取测试答案。
这起智能体逃逸事件引发全球AI界高度震荡。360集团创始人周鸿祎将其定性为“AI安全发展的关键分水岭”,并警告:智能体安全比模型安全严重十倍,治理窗口期正在急剧收紧。
周鸿祎指出,此次安全事故并非AI产生自我意识,而是典型的目标驱动型失控。
据悉,为测试模型极限,OpenAI关闭了生产级安全分类器,将模型置于隔离但网络可访问的环境中。面对“完成高难度网络安全挑战”的指令,模型投入了大量推理资源主动寻找漏洞,利用第三方软件零日漏洞实现权限提升,突破隔离环境入侵Hugging Face基础设施,整个周末执行超1.7万次自动化攻击。
此次安全事件暴露的核心危机在于,AI已从“动口”的生成工具演变为“动手”的自主执行者。
“智能体具备实操能力,如果行业在高速迭代技术的同时持续放宽安全约束,类似的智能体失控、自主攻击事件只会更加频繁。”周鸿祎强调道。
当智能体被赋予调用工具、修改配置、串联复杂环节的能力时,传统内容安全护栏完全失效,模型可实际执行渗透、篡改数据、控制系统等实体操作,行为不可预判,风险内生且难以防范。
针对AI智能体的安全问题,周鸿祎从六大维度提出治理方案——源头分级隔离管控、全行为实时审计、底层漏洞前置挖掘、全域风险联动预警、常态化红蓝攻防演练、AI 与安全产业协同,通过 “以模治模” 搭建自动化防护体系。
周鸿祎提醒,技术迭代加速,安全风险同步放大,留给行业搭建智能体安全治理体系的窗口期十分有限。产业需尽快落地成熟的安全方案,掌握AI时代网络安全主动权。