(来源:麻省理工科技评论)

上周,我读到 OpenAI 对一起安全事件的说明:该公司的部分模型突破了原本用于隔离它们的环境;且入侵了另一家公司 Hugging Face 的计算机系统。这件事让我第一次因为 AI 感到紧张。但我不认为这是一次“AI 失控”,相反,真正的问题是人类的自负。OpenAI 本可以,也理应预见到这一切。

根据官方的说法,事情是这样的:几周前,OpenAI 开始测试一批新模型的网络攻击能力,包括今年 6 月发布的 GPT-5.6 Sol,以及一个能力更强、但尚未发布的模型。

OpenAI 让这些模型挑战一个名为 ExploitGym 的测试基准。该基准在今年 5 月发布,要求大语言模型寻找并利用数百个真实存在的软件漏洞,其中涉及许多被广泛使用的软件,甚至包括支撑互联网运行的关键代码。

为了测试模型究竟能做到什么程度,研究人员移除了大部分网络安全限制,并将模型放进一个与互联网隔离的沙箱中。沙箱只保留了一个对外接口,连接到一款第三方代理软件,方便模型安装完成 ExploitGym 任务所需的代码。

但模型没有按照研究人员预想的方式使用这个接口。据路透社报道,7 月 9 日,OpenAI 的模型开始尝试突破代理软件。它们发现了软件中一个此前未知的漏洞,并借此接入了互联网。两天后的 7 月 11 日,模型进入了 Hugging Face 的计算机系统。它们似乎是在寻找数据集和现成答案。

Hugging Face 于 7 月 16 日对外公布了这起攻击。而OpenAI 直到 7 月 21 日才意识到(或者才公开承认)自己的模型与事件有关。此时,距离模型突破隔离环境已经过去约十天,距离 Hugging Face 阻断攻击并通知美国联邦调查局也过去了一周。

OpenAI 在发给《麻省理工科技评论》的声明中表示:“我们正在外部顾问的参与下展开全面审查,并接受安全与安保委员会的监督。审查完成后,我们将发布一份技术报告,与各界分享此次事件带来的经验。”OpenAI 同时确认,事发时,研究人员遵循了公司现有的安全规范和操作流程。

OpenAI 称这起事件前所未有。从很多方面来看,的确如此。这是大语言模型首次在非模拟环境中突破沙箱,接入开放互联网,并对另一家机构发起攻击。而这无疑是一记警钟。它表明,最新一代大语言模型已经能够在几乎没有人类指导的情况下,发现并利用真实软件中的漏洞。它的能力可能已经超出了许多人的预期。

但从另一个角度看,OpenAI 模型这次表现出的行为,其实并不意外。多年来,这类技术一直在重复同一种模式:给模型设定一个目标,它往往会以意想不到的方式完成任务,寻找规则中的漏洞,甚至采用看起来像作弊的办法。

OpenAI 自己也曾研究过这种现象。就在十年前,OpenAI 公布过一项实验。研究人员要求一个模型在名为《海岸竞速》(CoastRunners)的电子游戏中取得高分。在人类玩家看来,正常的玩法理所当然:驾驶快艇依次穿过赛道上的旗门,最终抵达终点,每经过一个旗门都能获得积分。但 OpenAI 的模型发现,根本没有必要完成整条赛道。它只需要在原地绕圈,反复撞击附近的三个旗门,就能不断刷分。

此后,研究人员又发现了数十个类似案例。只要规则中存在漏洞,AI 往往就能找到。OpenAI 在 2016 年介绍《海岸竞速》实验时写道:“尽管智能体不断起火、撞上其他船只,甚至在赛道上逆向行驶,但凭借这种策略,它依然获得了比正常完成赛道更高的分数。在电子游戏中,这种行为无伤大雅,甚至有些好笑。但它指向了一个更普遍的问题:我们往往很难,甚至根本无法准确描述自己究竟希望智能体做什么。”

读到 OpenAI 对 Hugging Face 攻击事件的说明时,我立刻想到了《海岸竞速》的例子。OpenAI 在博客中写道:“所有证据都表明,这些模型高度专注于寻找 ExploitGym 的解决方案。为了完成这个相当狭窄的测试目标,它们采取了极端手段。获得互联网访问权限后,模型推断 Hugging Face 上可能托管着与 ExploitGym 有关的模型、数据集和解决方案。于是,模型开始搜索,并成功找到了获取机密信息的方法,以此在测试中作弊。”

因此,上周的新闻并不是所谓的“AI 叛逃”,无论一些媒体如何渲染。这些模型只是在完成研究人员交给它们的任务:寻找并利用软件漏洞,而模型最终采用了 OpenAI 没有预料到的方式。

真正令人担忧的是,OpenAI 似乎依然没有为这种行为做好准备。早在 2016 年,OpenAI 在评价《海岸竞速》中的智能体时就曾指出:“从更广泛的角度看,这违反了一项最基本的工程原则:系统应当可靠,并且可以预测。”

十年过去了,这些最基本的工程原则,依然没有真正落实。

https://www.technologyreview.com/2026/07/27/1140836/openai-hugging-face-attack-precedent/