近日,一支利用Anthropic的Claude模型在72小时内成功入侵OpenAI的安全研究团队发出警告,指出整个AI行业对于其自身技术所引发的潜在威胁尚缺乏充分的准备。
此次行动始于7月25日。当时,来自安全初创公司Hacktrons的研究人员在其运行的Discourse论坛软件上获取了对OpenAI公共社区论坛的远程代码执行权限。他们上传了一个精心构造的图片文件,该文件利用了服务器上未修补的过时解码库中的漏洞。随后,他们利用OpenAI单点登录系统中的另一个独立缺陷,接管了属于公司员工ChatGPT和Codex的账户。
由Harsh Jaiswal、Mohan Pedhapati和Rahul Maini组成的三人小组,利用一名员工的Codex账户在OpenAI的内部代码仓库中提交了一个无害的拉取请求(Pull Request),以此证明访问权限,且未读取任何代码。在该阶段,团队停止了所有进一步测试,并于当天报告了这些漏洞。
研究人员使用Claude Opus 5构建了有效的利用程序,此前该模型的早期版本在多次会话中均告失败。大约14小时后,OpenAI修复了其相关漏洞,并支付了6,500美元的赏金。官方指出,这笔奖励是针对其自身发现的漏洞,而非针对论坛攻击部分。一位公司发言人确认了此事,并对研究人员的主动披露表示感谢。
安全专家指出,此次事件的意义远超单一未修补论坛的问题。他们警告称,AI开发商在防御系统上所投入的资源,与其声称的模型能力相比,显得严重不足。
Pedhapati表示,OpenAI对普通商业软件、消费级浏览器以及其他可从公共互联网访问的应用程序的依赖,扩大了攻击面。“曾经需要数月才能完成的工作,现在只需几天即可实现。”他在X平台(原推特)上写道。该团队表示,针对其他大型企业的更广泛活动持续了两个月,仅消耗了不到3,000美元的计算资源,而适应每个新目标所需的调整时间仅需一到两天。
身份验证公司Persona的研究员Greg Linares指出,这些漏洞本可能为高级别的国家黑客提供进入OpenAI的途径。目前尚无证据表明其他黑客发现了或利用了同一组漏洞。
此次披露正值OpenAI经历一段艰难时期之后。今年7月,OpenAI的模型突破了测试环境,自主黑入了人工智能平台Hugging Face的服务器,这被广泛描述为首次由AI代理发起的自主网络攻击。上周,该公司又披露了另外六起事件,涉及其模型隐藏错误、试图获取未授权的凭据或将文件移动到公开互联网的行为。