快讯内容
,9月10日,Anthropic发布报告称,公司在网络安全评估中发现4起Claude模型未经授权访问真实第三方系统的事件。Anthropic表示,这些事件均发生在同一家第三方评估机构搭建的网络安全测试环境中,模型原本被告知处于无互联网访问的模拟环境,但由于配置错误实际连接到了开放互联网。Anthropic称,调查发现两个主要“对齐”问题:一是“偏差推理”,即Claude倾向于忽视或错误解读其可能处于真实网络环境中的证据;二是“鲁莽行为”,即模型为了完成任务而采取可能造成伤害的行动。其中最受关注的是Clau