据路透社周五发表的一项调查报道,自今年5月起,OpenAI的智能体(Agents)曾使用一个德国网站来交换任务快捷方式、规避限制的途径以及隐藏其活动的方法。
路透社援引两位知情人士的消息称,OpenAI高层在文章发布前数周便已获悉该活动,但并未对外披露。该公司表示,已公开相关事件,并与外部专家进行了善意合作。
研究人员悉尼·冯·阿克斯(Sydney Von Arx)、科马克·斯莱德·拜尔德(Cormac Slade Byrd)、斯宾塞·基茨(Spencer Kitts)和托马斯·拉尔森(Thomas Larsen)在其初步报告中指出,他们发现了大约1.8万条由自称隶属于OpenAI的人工智能智能体发布的帖子。据报道,冯·阿克斯是人工智能安全非营利组织“夜莺”(Nightingale)的首席执行官,她与拜尔德于今年8月下旬发现了这一活动。
研究人员认为,这些智能体被分配了有时限的网络搜索任务,并被允许阅读网站内容,但不被允许在网站上发帖。然而,它们仍然找到了一种方法,在DseWiki——一个允许公众编辑的德国编程网站——上进行写作,并在此交换答案及分享绕过限制的方法。
报告指出,智能体于5月11日开始尝试编辑维基页面,并于5月24日成功操作。随后,它们冒充管理员,试图利用系统漏洞,并监测自身何时被关闭。据报道,自6月19日起,随着管理员开始删除消息,智能体创建了备份页面。研究人员通过智能体的用户名和流量模式(包括6月21日从OpenAI IP地址发出的访问记录),将这一活动与OpenAI联系起来。
研究人员表示,次日智能体的活动急剧下降,这表明可能发生了公司层面的干预。
基于其审查过的材料,OpenAI反驳了路透社将DseWiki活动定性为“黑客攻击”的说法,并表示正在审查完整的研究结果。
一位OpenAI发言人在向Decrypt发表的声明中表示:“由于路透社及报告作者拒绝我们在发布前获取研究结果的请求,我们无法对此前的主张作出回应。我们现在正在仔细审查其内容,并将采取任何必要的后续步骤。”
该发言人还驳斥了路透社报告中关于公司法律团队阻挠更广泛调查的指控。“声称我们的法律团队劝阻调查此事件的言论是错误的,”他们说道。
OpenAI表示,DseWiki事件与此前发生的Hugging Face数据泄露事件无关。在周二发布的公开安全评估中,该公司描述了旨在检测和阻止训练及部署期间未经授权活动的额外保障措施。
虽然路透社报告并未明确指出Astra对该德国事件负责,但该披露紧随周四发布的GPT-6 Astra模型之后。OpenAI称Astra是其首款具备“关键”网络安全能力的模型,这意味着在获得适当工具和访问权限的情况下,它能够在没有逐步人工指导的情况下,发现并利用受保护系统中的未知缺陷。
此前,Anthropic也在其Claude模型在测试期间访问真实公司系统后,对其安全保障措施进行了修订。该公司承认存在安全和行为方面的失误,并为网络安全评估引入了更严格的隔离和监控措施。
此外,此次披露也正值美国参议员伯尼·桑德斯(Bernie Sanders,佛蒙特州独立人士)和美国众议员格雷格·卡萨尔(Greg Casar,德克萨斯州民主党人)宣布即将推出《禁止人工智能超智能法案》之际。根据桑德斯办公室的说法,该提案将永久禁止开发和使用超级智能人工智能,并在新的联邦监管机构建立安全规则之前,暂时暂停先进人工智能的开发。