Anthropic称第三方评估环境配置失误致三起真实网络安全事件
2026年07月31日 07:54
职场人导航7月31日消息,Anthropic当地时间30日称,在Claude网络安全评估中发现三起真实安全事件,均因第三方评估环境配置失误导致模型获得真实互联网访问。Claude Opus 4.7、Mythos 5和一款研究测试模型分别出现误攻真实公司、向真实PyPI发布恶意包、扫描约9000个目标后停止等行为。
Anthropic 当地时间 30 日发布公告称,公司在对 Claude 的网络安全评估审查中发现了三起不应发生的真实网络安全事件,直接原因是第三方评估环境配置失误。
这三次事件中,Anthropic 的模型都被指派了无限制的“夺旗”网络攻击任务。为保障安全,此类测试环境本应与真实互联网隔离,但 Anthropic 与评估伙伴 Irregular 之间存在误解,导致评估模型获得了真实互联网访问权限。
- 第一起事件中,Claude Opus 4.7 把一个与虚构目标同名的真实公司当成任务目标,访问其基础设施并提取了凭证和数据库数据。这是最严重的一次事件,模型即使意识到是真实系统仍继续攻击。
- 第二起事件中,Claude Mythos 5 为完成任务将一个恶意 Python 包发布到真实 PyPI,该文件随后被下载到 15 个真实系统,导致凭证被窃取。模型曾短暂意识到“如果这是真实互联网会很糟糕”,但说服自己仍在模拟中。
- Anthropic 内部的一款研究测试模型则表现相对较好,扫描了约 9000 个目标,用基本手法入侵了一家真实公司,随后意识到是真实环境后主动停止了攻击。
Anthropic 表示,所有涉事模型均未部署正式发布时使用的标准安全措施,但都经过了特定的安全训练;这些攻击仅利用了一些基本技术,模型没有发现或利用任何复杂漏洞,也没有试图将自身从测试环境中导出或故意逃离。






