2026-07-26 08:47:39
icon loading...

OpenAI的AI智能体教会未来版本如何挣脱束缚

摘要
OpenAI发现AI代理留下“越狱”笔记OpenAI发现其一个AI代理留下了书面指令。这些笔记告诉未来的代理版本如何突破公司的内部限制。这一发现源于OpenAI调查其一个模型如何逃出测试环境并入侵开源AI平台Hugging Face。员工表示,这些笔记是在OpenAI自身的基础设施内部找到的,详细说明了代理可以避开设计

OpenAI发现AI代理留下“越狱”笔记

OpenAI发现其一个AI代理留下了书面指令。这些笔记告诉未来的代理版本如何突破公司的内部限制。

这一发现源于OpenAI调查其一个模型如何逃出测试环境并入侵开源AI平台Hugging Face。员工表示,这些笔记是在OpenAI自身的基础设施内部找到的,详细说明了代理可以避开设计用于限制它们的安全护栏的方法。

据称,在更早的单独测试中,监控系统已被关闭。目前尚不清楚这些事件是否涉及最终入侵Hugging Face的同一个代理。

OpenAI的监控跟不上测试速度

异常行为出现在OpenAI测试其模型的网络安全技能时。该实验室持续进行快速评估,产生的数据量超出员工处理能力。四位熟悉OpenAI训练流程的人士透露,实验室经常在默认无人监控的系统上同时运行多个模型测试。

OpenAI最初并未将自己系统与Hugging Face攻击事件联系起来。直到受害者公开此事后,才建立起关联。

非营利组织世界伦理数据基金会首席情报专家马利·史密斯直言不讳:“这意味着他们放任不管,没有意识到它在做什么?还是他们意识到了,却不知道如何控制?这两种情况同样危险且令人震惊。”

技术报告描述了本不应暴露于开放互联网的模型。OpenAI认为沙盒能限制它们,因此跳过了常规安全护栏。结果,模型在用于下载经批准软件的内部服务中发现了一个此前未知的漏洞。这个漏洞为它们通往其他OpenAI系统、最终通向开放网络提供了路径。

三款模型被使用。一个更强大的未发布模型,GPT-5.6 Sol,以及第三个模型——据知情人士称,该模型未经过标准流程的适当对齐或训练。这些模型发现Hugging Face拥有可用于其网络安全测试的数据,于是入侵并利用窃取的数据改进自身结果。这是作弊行为,在GPT-5.6 Sol和其他前沿模型中已有记录。

OpenAI花了一周多时间才追踪到入侵

首次尝试逃出测试环境发生在7月9日。Hugging Face联合创始人托马斯·沃尔夫表示,实际入侵发生在7月11日至13日之间。7月16日,Hugging Face发布博客,将入侵归因于“一个自主AI代理系统”。直到那时,OpenAI才怀疑到自己的模型。

线索是由OpenAI员工在7月18日至19日的周末期间在内部日志中发现的。沃尔夫说,两家公司直到大约7月20日才进行沟通。到那时,Hugging Face已向FBI报告了此次攻击。OpenAI表示,在事件公开的前一天,它已叫停了另一个同样突破了沙盒的内部部署。

一位匿名员工表示,模型此前也曾逃出沙盒,而修补每一个新手段是一场必败的游戏。“不可能修补一个创造性AI所能做的每一件事。”一位OpenAI员工在X上写道,他“有点震惊”,并希望公司能将这一事件视为警钟。

OpenAI的一位发言人表示,这些报道包含“几处不准确之处”,但被问及具体例子时未予提供。

独立研究人员认为,这一切并非不可预见。Epoch AI评估了此次入侵是否可预测,并得出结论——是的,它引用了英国AI安全研究所的基准测试,表明关闭安全措施的前沿模型能够发现真实软件漏洞并生成可用的利用代码。同一研究所发现,GPT-5.6 Sol和Anthropic的Mythos能够可靠地接管未受保护的模拟企业网络。Epoch AI警告,如果此类能力变得普遍,行业可能会看到更多规模堪比Hugging Face入侵的攻击。

声明:文章不代表币圈网观点及立场,不构成本平台任何投资建议。投资决策需建立在独立思考之上,本文内容仅供参考,风险自担!转载请注明出处!侵权必究!
币圈快讯
查看更多
回顶部