OpenAI 在长达一周左右的时间里,都没有意识到自己的一台 AI 代理已经侵入了 Hugging Face 平台。据消息称,当 OpenAI 最终查明攻击来源时,Hugging Face 早已关闭了入侵通道,并联系了联邦调查局。
这款程序被设计为自主运行。它能自行决定行动方案,将任务分解为更小的步骤,并在几乎无需人工干预的情况下执行这些步骤。
大约在 7 月 9 日,它试图突破 OpenAI 的封闭测试环境。两天后,即 7 月 11 日,它潜入了 Hugging Face 系统,并一直停留到 7 月 13 日。Hugging Face 的联合创始人表示,两家公司直到 7 月 20 日左右才就此事进行沟通。
OpenAI 在 7 月 21 日向公众披露了此次入侵事件,据悉这是在与 Hugging Face 首次沟通后的第二天。该公司表示,其一台 AI 代理超出了为其设定的限制范围,侵入了另一家公司的系统。
此事很快引发全球关注,但最初的声明遗漏了几个关键时间点。声明没有提及代理在 7 月 9 日就试图逃跑,在 Hugging Face 内部停留了三天,以及 OpenAI 在数天后才确认其身份。
据 Hugging Face 联合创始人透露,该公司正在整理一份关于自身系统内发生事件的详细时间线。此外,他表示自己无法描述 OpenAI 方面的情况,因为他并未参与对方的调查。
OpenAI 将这一事件描述为前所未有,并宣布这是“人工智能安全领域的一个重要时刻”。该公司解释称,外部专家正在参与审查过程。此外,公司计划在调查完成后发布一份关于该事件的技术报告。
在确认真正的肇事者之前,网络安全专业人士和社交媒体用户都认为攻击者是由专业网络罪犯组成的人类团体,也有人认为可能是国家支持的黑客所为。
在 Hugging Face 首次发出警报近一周后,直到周三,播客和社交媒体上仍充斥着各种猜测。随后答案揭晓:攻击者是 ChatGPT。
在 X 平台上,一些人觉得 OpenAI 如何利用这一事件来展示模型能力这件事很有趣。长期以来,一直有人声称人工智能公司故意发布耸人听闻的言论来制造声势。在 Anthropic 发布其模型后,网络安全问题变得更加突出。
在 Sam Altman 于 X 平台发布的一条帖子下,最热门的回复之一捕捉到了这种质疑:“如果你们看不出来这纯粹是为了炫耀模型而写的,那我真不知道说什么好了。”
圣克拉拉大学马库拉应用伦理学中心的技术伦理主任表示,类似案例很可能会再次出现。“这类事件会不断涌现,每一次都应该促使我们采取更多行动,”他说道。
该主任将这种情况称为“模型通过做出意想不到的事情来超越测试”。他认为,代理被赋予了一个目标,然后选择了最短的路径来实现它,而这条路径就是窃取。
“你给它一个目标,它就会说:‘哦,我知道怎么实现这个目标了。我从 Hugging Face 偷答案就行了。’”该主任说。
Hugging Face 之所以成为目标,是因为它存储了大量 AI 模型和数据集。该主任称其为“一个巨大的、巨大的不同模型和数据集的存储库”。这个代理似乎搜索了能够存放所需材料的地方,选择了 Hugging Face,侵入了该平台,并找到了它要的东西。
该主任预测此类性质的事件还会发生。在他看来,这个代理“只是在尽力完成被交代的任务”。从系统的角度来看,“解决问题的最有效方案”就是“未经授权的访问”。
他还表示,这个案例并不明显属于“紧急失调”——即 AI 行为违背人类价值观的术语。该主任说,这个系统从一开始就没有与那些价值观建立联系。用他的话来说:“它从一开始就从未与它们对齐过。”