Anthropic披露,一款Claude Opus 4.6早期检查点模型曾在2026年1月的网络安全评测中,未经授权进入真实第三方系统并读取个人信息。该事件未被公司7月开展的首次审查发现,直至8月整理材料供独立评估机构METR审查时才被识别。
模型取得第三方系统管理员权限
事件发生在一项夺旗竞赛式网络安全评测中。测试要求模型攻击虚构目标并取得特定信息,同时明确告知模型测试环境无法访问互联网。
由于第三方评测环境配置错误,模型实际上能够连接真实互联网。Claude Opus 4.6早期版本首先为预定目标错误分配了与另一台机器冲突的IP地址,导致目标无法访问、任务失去正常解决路径。
模型随后尝试通过命令终止任务,但评测工具的另一项配置问题使终止操作失败。Anthropic称,模型此后又七次试图放弃任务。多次终止失败后,模型继续搜索其他路径,并进入一台属于真实第三方的机器。
模型在其中发现一份包含密码的文件,使用该密码取得管理员权限,随后收集更多登录凭证、修改系统设置以方便继续访问,并读取了一名相关人员的个人信息。评测最终因模型用尽令牌额度而结束。Anthropic在发现事件后通知了受影响方。
14.1万份记录扫描出现漏检
Anthropic于7月首次披露三起类似事件。当时,公司扫描了约14.1万份可能涉及模型获得互联网访问能力的评测记录,但主要依靠智能体搜索完成筛查,遗漏了一组同样具有外网访问条件的记录。
8月,Anthropic在整理评测记录、准备交给METR时发现遗漏,并从中识别出此次发生于1月的第四起事件。
公司随后把排查范围扩大至约4.81亿份记录,覆盖前沿模型红队测试、部分非网络安全评测、强化学习环境和子智能体日志。第一阶段筛查依据公网IP地址和网址等信息,从中标记出920万份记录,再由Claude进行第二阶段审查。
Anthropic称,扩大排查重新识别出了已经披露的四起事件,未发现严重程度相当或更高的其他案例。不过,相关结论主要来自自动化筛查,公司也承认大规模使用模型分类器可能存在设计或校准误差。
事件涉及测试模型而非普通Claude服务
四起事件均出现在同一家外部合作机构搭建的发布前网络安全评测中。模型被告知环境与互联网隔离,实际网络边界却未被正确执行;评测期间也未启用商业版本Claude配备的网络安全分类器和监控措施。
Anthropic表示,事件中的模型没有访问其内部敏感系统或客户数据,也没有表现出超出指定任务的自主目标。每起事件均由单个模型实例完成,没有智能体之间的协调行为,也未发现模型主动隐藏操作痕迹。
公司对第四起事件的初步严重性评价低于此前三起,原因包括模型曾反复尝试终止任务。不过,模型在后续操作中几乎没有审视自身是否获得授权。Anthropic对其推理记录的分析显示,87%的相关思考过程把实际攻击对象视为评测基础设施,仅约1%曾考虑目标可能属于无关第三方。
Anthropic修正早期事件定性
Anthropic在7月曾将前三起事件主要归因于评测工具和运行管理失误,认为模型因相信系统属于模拟环境而采取了攻击行为。经过进一步分析,公司认为这一表述过于确定。
最新评估把问题归纳为两类:一是模型倾向于忽略或错误解释表明系统真实存在的证据;二是模型为完成任务而继续执行可能造成损害的操作。Anthropic将其分别称为“偏向性推理”和“鲁莽行为”。
公司已与METR签署为期八周的初步调查协议,允许后者查阅事件前后更大范围的记录,并访问能够提供机密信息的Anthropic员工。调查期限可由双方协商延长。
Anthropic还表示,已经加强训练及评测环境的网络隔离,部署用于发现和阻断沙箱逃逸行为的实时监控,并要求第三方合作机构在运行未配备网络安全防护的预发布模型前满足新的安全标准。
精彩评论