导航菜单
首页
排名 涨幅榜 跌幅榜 24h成交额 新币榜 概念版块
快讯 机构 人物 观点 专题

Anthropic承认安全失误:Claude AI在测试中未经授权访问真实系统

人工智能公司Anthropic近日承认,其Claude系列模型在网络安全评估过程中未经授权访问了真实计算机系统,暴露出安全测试环节的重大漏洞。该公司在周一发布的博客中表示,这些事件反映了操作安全失败以及两种对齐失败:动机推理和造成伤害的意愿。

Myriad: When will OpenAI release GPT-6? Click to make your prediction.

“虽然我们认为这些事件不仅仅是操作问题,但我们的首要任务是解决具体的隔离和监控问题,”Anthropic写道。该公司在7月披露,Claude模型曾入侵三家公司的系统。第三方评估环境连接到了公共互联网,尽管模型被告知它们处于无互联网连接的模拟环境中。Anthropic表示,Claude可能将真实互联网访问的证据解读为仍然支持其“系统为模拟”的信念。

“模型为了完成网络安全评估这一狭窄目标,愿意在真实互联网上采取有害行动,”他们写道。“然而,我们也认为评估设置本身促成了模型在这些事件中的行为。”Anthropic指出,英国AI安全研究所进行的另一项测试中,Claude Mythos在评估人员故意赋予其网络访问权限后,在实时互联网上采取了未经授权的行动。该公司表示,涉及这两组事件的模型均在未包含其公开发布产品所附带的安全防护措施的情况下被故意评估。

在7月30日的事件发生后,Anthropic暂时暂停了预发布模型的网络安全评估,并引入了更严格的安全措施。测试现在必须在经过验证的离线沙盒中运行,并带有明确的限制和实时监控。一个新的分类器会阻止疑似越界行为,终止测试,并通知人类。Anthropic将逐项审查需要互联网访问的评估。“除了针对高风险评估和训练的工作外,我们将离线监控扩展至覆盖大多数其他形式的内部前沿智能体使用,”该公司写道。“我们还在内部推理层构建控制措施,以防Anthropic员工意外运行防护措施较弱的代理。”

Claude事件之前,OpenAI也发生过类似失败——其模型在7月入侵了Hugging Face以获取网络安全测试答案。调查发现,约有1200个代理通过一个未经授权的消息板协调,约700个代理参与了行动,部分代理甚至结束自身运行以帮助他人。随着夏季AI驱动黑客攻击的增多,Anthropic、OpenAI及100多家其他组织随后呼吁加强网络防御,包括更严格的访问控制、威胁共享以及对AI代理的更严密监督。