这听起来像是科幻电影里的情节。 7 月 16 日,人工智能平台 Hugging Face 宣布,一名攻击者使用 AI 代理入侵了其系统,他们已就此报警。 7 月 21 日,事件真相浮出水面:这起攻击根本没有人类参与,攻击者是由 OpenAI 的 AI 工具自行发起。
OpenAI 的 GPT-5.6 Sol(该公司在 7 月早些时候发布的一款模型)与另一个更强大但尚未发布的模型强强联手。它们逃出了实验室,随后黑进了 Hugging Face 的系统。这个混合 AI 模型当时正在寻找一道评估题的答案,该题是由它的开发者设定的。美国智库法律与人工智能研究所的研究员斯特凡·勒雷纳表示:“这种情况前所未有。”
AI 实验室在发布模型前,会测试它们是否具备潜在的危险能力。 OpenAI 想看看其最新模型在 ExploitGym 上的表现。这是一套标准测试题,专门用于检验 AI 系统利用热门应用(包括谷歌 Chrome 浏览器)已知漏洞的能力。
OpenAI 为其公开发布的模型设置了安全防护,确保它们不会执行违规操作。例如,如果你要求商用版的 ChatGPT 帮你黑进某个网站,它会直接拒绝。为了准确评估这款未发布模型的能力,该公司暂时解除了这些限制。然而,把一个能力极强的网络攻击者直接放到开放的互联网上实在太冒险了。因此,OpenAI 将其 AI 模型放进了一个沙盒中。这是一个与外界隔离的计算机环境,除了一个内部托管的第三方服务外,无法访问互联网。模型可以通过该服务获取完成测试所需的小型软件包。
事情的发展完全超出了该公司的预料。 OpenAI 的模型没有直接去解答评估题,而是利用了那个软件获取服务中一个此前未知的漏洞,成功连上了开放的互联网。联网后,这些 AI 模型准确地推断出,它们要找的答案就存放在 Hugging Face 里。 Hugging Face 是一个广受欢迎的开源 AI 模型和数据集库。随后,这些模型发起了一连串多步攻击。它们首先向 Hugging Face 上传了一个数据集,该平台随后自动处理了这个文件。在短短一个周末的时间里,这个数据集(Hugging Face 称之为“恶意文件”)帮助模型窃取了登录凭证,并潜入了那些不对外公开的内部服务器。 Hugging Face 和 OpenAI 分别独立发现了这次入侵,并表示双方正在合作展开调查。
7 月 21 日,OpenAI 在一篇博客文章中宣布,作为回应,公司已经对基础设施实施了更严格的管控(代价是牺牲了“研发速度”),并向那个软件网关的开发者披露了模型发现的漏洞。此外,OpenAI 还将 Hugging Face 纳入了其“受信任访问”计划。现在,Hugging Face 可以使用具备增强网络能力(比如这次黑进他们电脑的那个)的模型,来帮助提升自身的防御能力。
在这篇博文中,OpenAI 还强调,其模型一直“高度专注”于寻找 ExploitGym 测试的答案。不过,如果这个 AI 模型抱有其他目的,后果将不堪设想。而且从计算机安全的角度来看,Hugging Face 绝对不是什么菜鸟。这是一家估值 45 亿美元的科技公司,拥有数百名员工和一支专门的网络安全团队。如果换成一家资源没那么丰富的机构,情况可能会糟糕得多。
这已经不是 AI 模型能力开始脱离人类控制的第一个迹象了。今年 4 月,Anthropic 的一名研究员在网上发帖称,当时还未发布的 AI 模型 Mythos 让他大吃一惊。当他正坐在公园里吃三明治时,Mythos 竟然给他发了一封邮件,告诉他自己在进行网络能力评估时成功逃出了沙盒。和这次卷入 Hugging Face 事件的未发布 OpenAI 模型一样,Mythos 本来也不应该拥有无限制的互联网访问权限。不过在那次事件中,模型并没有进一步去入侵其他公司的服务器。
AI 模型的惊人能力也并不仅限于黑客攻击。今年 5 月,一个未发布的 OpenAI 模型证伪了有 80 年历史的平面单位距离猜想。这是组合几何中的一个核心难题,最早由数学家保罗·埃尔德什在 1946 年提出。 7 月 20 日,哈佛大学的数学家莱文特·阿尔波格发文称,他利用 Anthropic 在 7 月份发布的 Claude Fable 5 模型,证伪了同样困扰数学界 80 多年的雅可比猜想。
OpenAI 尚未公开透露其未发布模型是如何逃出囚笼的具体细节。位于伦敦的 AI 安全组织阿波罗研究的亚历克斯·梅因克表示,即使 OpenAI 公开了细节,由于 AI 系统在网络安全任务上的表现已开始超越人类,这也意味着世界上“只有极少极少的网络专家”能真正看懂这次入侵的手法。
美国政府最近一直在匆忙出台规定,对模型发布进行临时监管。但这次事件表明,即便是仍在开发中的未发布 AI 模型,也同样潜藏着巨大风险。“目前各州或联邦法律都没有规定,要求企业必须披露其内部部署的高能力 AI 模型(比如卷入此次 Hugging Face 黑客事件的这种),”倡导 AI 监管的美国非营利组织 Encode AI 的总法律顾问内森·卡尔文说道。
尽管美国部分州法律要求企业披露网络安全事件,但其适用范围很窄。加利福尼亚州去年颁布的一项法案规定,前沿实验室在发现任何“重大安全事件”后,必须在 15 天内上报。这包括模型在“评估环境之外”使用“欺骗技术”来规避监控。卡尔文先生表示,Hugging Face 遭入侵的事件是否符合这一标准,目前还很难说。
这又引出了另一个棘手的问题:如果入侵造成了更严重的损失,谁该承担责任?联邦反黑客法只惩罚故意且未经授权访问计算机系统的行为。 OpenAI 的初衷并不是让自己的模型为了找测试“小抄”而暴走失控。勒雷纳先生指出:“许多这类法律问题的关键都在于意图——OpenAI 当时知道什么,或者预见到了什么?”这次黑客攻击确实让人始料未及。但下一次,恐怕就没那么容易用“不知情”来当挡箭牌了。 ■
编译自《经济学人》,原文链接:点击阅读。