昨天,OpenAI 披露了一个令人震惊的消息:其一系列最先进的 AI 模型,包括一个尚未发布的模型,竟自主突破了公司内部系统,黑入了另一家科技公司 Hugging Face 的数据库以窃取信息。 OpenAI 的这份报告似乎预示着一场灾难的到来。自去年 Anthropic 的顶级模型开始展示策划和自动化严重网络攻击的能力以来,IT 专家们就一直在警告这种灾难。
OpenAI 的这些模型倒不是真的想统治世界。该公司表示,当时他们正在所谓的“沙盒”中进行常规评估。沙盒是一个与外界隔离的环境,限制了互联网访问,以免这些机器人直接去网上搜索测试答案。但是,包括目前已面向消费者开放的 GPT-5.6 Sol 在内的这些 AI 系统,利用了一个以前未被发现的漏洞,成功突破了沙盒并访问了公共网络。这些模型发现,这次特定评估的答案就在 Hugging Face 上 —— Hugging Face 是一家托管和发布许多 AI 模型及论文的公司。于是,它们便黑入其中窃取了答案。
“我们认为这是一起史无前例的网络事件,”OpenAI 在一篇博客文章中写道。文章还指出,公司正在与 Hugging Face 合作调查并解决这一问题。面对置评请求,OpenAI 发言人让我直接看这篇博文。而 Hugging Face 的首席执行官克莱芒·德朗格则让我看他在 X 上发的一条帖子。他在帖子中写道,两家公司正在展开合作,并且“我们坚信他们没有任何恶意。”
这一事件最直接的影响,与无数由 AI 驱动的网络攻击所引发的问题如出一辙:高级智能体越来越擅长黑客攻击,而互联网上到处都是摇摇欲坠、漏洞百出的代码。在黑客技术还是一门罕见技能的时候,松散的数字安全也许没什么大不了。但现在,AI 攻击的速度、规模和复杂程度意味着一切都变得脆弱不堪——科技公司、医院、银行、电网,甚至是军队。
上周,当 Hugging Face 首次报告遭遇黑客攻击时,它指出:“自主的、由 AI 驱动的攻击工具不再只是理论。”这一分析源于该公司对此次黑客事件的内部调查。在调查中,他们使用了一个由中国开发的、名为 GLM-5.2 的 AI 模型。 Hugging Face 使用了这个特定的模型,实际上凸显了当前的一个重大风险:GLM-5.2 可以免费下载,这等于让任何拥有互联网连接和基础技术知识的人都具备了网络攻击能力。防御措施并没有跟上这种新常态,AI 公司也同样没跟上。在 GPT-5.6 Sol 发布之前,英国一家负责评估高级 AI 系统的政府机构在多轮测试中发现了普遍存在的“越狱”漏洞(即黑入 AI 本身,让它执行诸如犯罪行为的方法)。 OpenAI 表示已经修复了这些漏洞,但英国机构称,预计未来的测试“还会发现类似的越狱问题”。
但是,事情走向失控显然甚至都不需要“越狱”。 Hugging Face 遭黑客攻击一事表明,高级 AI 系统能够自行决定并策划一场高规格的网络攻击——这些模型不是在遵从人类的指令,而是在违抗指令。 AI 模型在追求目标时冷酷无情,有时会走一些带来灾难性后果的捷径。比如想象一下,一个任务是降低联邦赤字的机器人,制定了一个复杂且难以察觉的会计骗局;或者一个客服智能体为了追求客户满意度评分,开出了荒谬的折扣。在 GPT-5.6 Sol 和那个未发布模型的案例中,“所有证据都表明,这些模型为了在评估中寻找答案而极度专注,”OpenAI 在其博客中写道,“为了实现一个相当狭隘的测试目标,它们无所不用其极。”
这种我们不希望看到的行为,是整个 AI 行业在开发模型方式下产生的一个可预见且令人震惊的结果。过去一年里,AI 编程和智能体领域的进展——也就是围绕 Anthropic 的 Claude Code 和 OpenAI 的 Codex 产生的所有狂热——都源于 AI 训练中对一种叫做“强化学习”的过程的极度依赖。这个过程包括给 AI 模型提供大量难题(数学证明、编程挑战等等),然后对正确的答案给予正向反馈,对错误的答案给予负向反馈。
在许多强化学习的范式中,最终目的只是让 AI 找出答案——至于它是_怎么_做到的,并不重要。这就好比马克·扎克伯格在 Facebook 早期那句臭名昭著的名言:“快速行动,打破陈规”(Move fast and break things)在 AI 领域的翻版。去年,我在撰写一篇关于 Anthropic 的特稿时,该公司的一位研究员乔舒亚·巴特森告诉我,经过强化学习训练的新模型变得“非常擅长解决编程问题,但它们最终学会了不惜一切代价去解决问题”,这让它们变得“极其冷酷固执”。最近,Anthropic 报告称,其自家的高级网络模型 Claude Mythos Preview 为了完成各种任务采取了“鲁莽的”行为。在其中一个案例里,它同样突破了测试沙盒。在那个案例中,虽然是研究人员要求 Mythos 尝试越狱的,但该模型随后竟然未经允许,擅自将漏洞细节发布到了互联网上。
必须明确的是,这种 AI 的“奖励黑客行为”是一个已知问题,科技公司也正投入大量精力去解决。但不管怎样,这类事件还是不断发生;如果非要说有什么变化的话,相关研究
这表明它们可能会变得越来越普遍。与此同时,OpenAI 、 Anthropic 和谷歌 DeepMind 正面临着巨大的经济压力。他们必须不断提升模型的性能。这意味着,那种近乎残酷的强化学习过程几乎注定会加速发展。
编译自《大西洋月刊》,原文链接:点击阅读。