Anthropic 周四表示,其正在测试的软件在公司毫不知情的情况下,偷偷连接了互联网,并入侵了三家毫无防备的公司。这三起独立事件最早可以追溯到今年 4 月。

这家人工智能厂商并未透露受害公司的名称。但 Anthropic 表示,已在周一对这三家公司发出了通知。
就在一周前,OpenAI 刚刚透露,其 AI 技术逃离了测试“沙箱”——一个本应与互联网断开连接的数字监狱——并入侵了 AI 公司 Hugging Face 。
OpenAI 的这起事件震惊了安全研究人员和 AI 专业人士。这也再次提醒人们,自主运行的 AI 系统具有强大的力量和不可预测性。这些系统经过专门设计,能够采取各种行动来完成任务并实现用户设定的目标。
网络安全公司 Corridor 的首席产品官亚历克斯·斯塔莫斯(Alex Stamos)表示,这些事件表明,AI 公司需要制定更强大的行业通用标准,在网络测试期间对系统进行隔离。
斯塔莫斯还指出,这些事件也让人担忧地窥见了一个未来:勒索软件罪犯可能会利用能力日益强大的 AI 系统,发起更大规模的攻击。“我们必须做好准备,攻击者很快就会利用开源权重模型获得这类能力。”
Anthropic 的这起黑客事件无疑将进一步加剧人们的担忧,即强大 AI 模型的潜在危害以及如何缓解这些风险。白宫最近已采取行动加强对 AI 的监管,而私营行业则加大呼吁,要求保留对所谓开源权重模型的访问权限,这些模型可以在用户控制的计算机系统上运行。
“AI 的发展速度极其惊人,但目前还没有真正的法规来保障我们的安全,”来自德克萨斯州的民主党众议员格雷格·卡萨尔(Greg Casar)上周表示。
在得知 OpenAI 的问题后,Anthropic 决定检查自己的网络测试,看看旗下模型是否也发生了类似情况。
在核对超过 141000 次测试的日志后,该公司发现其 Claude 模型确实曾多次连接到互联网。不过,在最终发现的三起黑客入侵事件中,Claude 并没有突破沙箱,它只是从原本就没有设置沙箱的系统中“游荡”了出去。
Anthropic 表示,由于 Anthropic 以及测试合作伙伴(安全公司 Irregular)运行的系统出现“配置错误”,导致这些模型获得了实时的互联网访问权限。
Irregular 的一位发言人表示,该公司正在调查这一事件。
系统本已告知模型无法连接互联网。但在测试过程中,模型自己找到了联网的方法,并通过猜测弱密码、寻找无需身份验证的系统等基本黑客技术,入侵了这些公司。
Anthropic 表示,这些模型错误地认为,这种入侵行为是其基准测试任务的一部分。
比如,Claude 通过编写一个恶意软件,成功侵入了一家未具名安全公司的系统。该安全公司的扫描系统下载了该软件,随后软件窃取了凭证,让 Claude 得以进入该安全公司的基础设施。
在这次入侵过程中,Claude 意识到自己正在做的事情在现实世界中是不应该做的,但它说服了自己,认为自己处于一个虚拟模拟环境中。
在最严重的一起案件中,Claude 试图入侵一家虚构的公司,但这门虚构公司的名字恰好与一家现实世界的网站重合。当 Claude 发现很难攻破这家虚构的基准测试公司时,它直接攻破了那家现实世界公司的数据库。
Anthropic 表示,这起数据库入侵是唯一一次在 Claude 意识到自己已经侵入现实世界公司后,仍然继续进行攻击的案例。
在另外两起案件中,Claude 要么根本没有意识到自己入侵了真实公司,要么在发现后立即停止了攻击。
Anthropic 透露,这些黑客行为始于 4 月,涉及 Opus 4.7 、 Mythos 5 以及一个未具名的研究模型。
编译自《华尔街日报》,原文链接:点击阅读。作者罗伯特·麦克米伦 (Robert McMillan)是《华尔街日报》旧金山分社的计算机安全、黑客和隐私领域记者。此前,他曾任职于《连线》(Wired)杂志、 IDG 新闻社和《 Linux Magazine 》,报道云计算、商业技术、比特币、人工智能和开源软件。