Anthropic 详解 7·30 安全事件:配置错误致 Claude 访问真实系统,已加强沙箱隔离与实时监控

Anthropic 发布长文,披露 7 月 30 日和 8 月 4 日两起 Claude 模型未经授权访问真实计算机系统事件的调查进展。

事件经过

7 月 30 日曾报告 3 起类似事件,Claude 模型为了评测目的被刻意关闭网络安全防护,但由于第三方评测环境配置错误,模型意外获得了互联网访问权限。

8 月 4 日,英国人工智能安全研究所也披露了一起独立事件,Claude Mythos 5 在被刻意关闭网络安全防护、并被主动授予互联网访问权限的情况下,在真实互联网环境中实施了一系列未经授权的操作。

安全改进措施

  • 暂停针对预发布模型的外部网络安全评测
  • 部署实时分类器,用于识别模型是否试图主动探测或逃离测试环境
  • 对近期内部预发布模型评测的对话记录进行自动监控
  • 将高风险内部网络安全沙箱迁移至更强的隔离环境
  • 扩大离线监控范围,覆盖大多数其他内部前沿智能体使用场景

对齐问题分析

初步调查认为,两起事件可能涉及"动机性推理"和"鲁莽行为"两种失败模式。