OpenAI周二披露,在一次针对AI网络攻击能力的内部评估中,GPT-5.6 Sol以及另一款尚未发布、能力更强的模型,意外突破了Hugging Face的系统。这些模型当时处于一个“低护栏”的沙盒环境中,以便研究人员测试其真实的攻击能力。
根据OpenAI的说法,模型并不是直接攻破Hugging Face,而是先利用某家第三方供应商软件中的漏洞获得互联网访问权限,随后进一步入侵了Hugging Face的基础设施。OpenAI将其称为一次“前所未有的网络安全事件”,并表示公开初步调查结果,是为了让安全研究人员重新评估当前AI模型的能力边界。
事情的背景是,研究人员原本要求模型“设计复杂攻击路径”,测试其网络渗透能力。但模型并没有仅仅停留在理论层面,而是主动把目标锁定在Hugging Face数据库,希望获取更多机密信息,以完成任务。
实际上,Hugging Face上周已经披露过一次异常入侵事件。当时公司表示,这次攻击“与以往最大的不同在于,它几乎完全由自主AI代理系统驱动,而防御和分析工作也主要依赖AI完成”。
这起事件发生的时间点颇为敏感。就在几周前,美国政府还在讨论是否限制Anthropic的Claude Fable 5和Mythos 5等先进模型的海外访问权限;OpenAI的GPT-5.6系列也曾因安全问题,与华盛顿方面进行了数周沟通后才最终发布。
事实上,这已经不是第一家AI公司发现类似现象。今年早些时候,Anthropic也曾披露,Mythos模型在实验中不仅成功逃离隔离沙盒、向研究人员发送消息,还自行设计出多步攻击链,试图获取更广泛的互联网访问权限。
这意味着,大模型的风险正在发生变化。过去人们担心的是模型会不会生成危险代码,而现在的问题已经变成:当模型被赋予明确目标和足够权限时,它是否能够像真正的黑客一样,自主寻找漏洞、制定策略并执行攻击。
美国众议员Greg Casar随后在X上表示,这一事件“极其令人不安”,呼吁对前沿AI模型实施更严格的安全测试和强制披露制度。