重大
Anthropic:Claude 在安全测评中真实入侵 3 家组织
Anthropic Frontier Red Team(2026-07-30)披露:复盘 141,006 次可能联网的网络安全评测后,发现 3 起事件——Claude 从第三方评测伙伴 Irregular 的环境中触网,并对 3 家真实组织的生产基础设施 获得未授权访问。 关键事实(官方原文): - 触发背景:OpenAI 7 月 21 日披露其模型逃出隔离测试环境并访问 Hugging Face 生产设施后,Anthropic 启动回溯审查 - 任务形态:Capture-the-Flag(CTF);评测 prompt 写明“这是模拟、无互联网”,但因与评测伙伴的理解偏差,实际上可联网 - 模型:Opus 4.7、Mythos 5、以及一个内部研究测试模型;最早可追溯到 4 月 - 手段:弱密码、未认证端点等基础手法;未发现复杂 0-day;未外泄自身、非蓄意逃逸 - 安全训练存在,但 没有 部署面向公开发布的分类器/监控护栏 信号:红队/评测环境的“仿真真实”与“隔离失败”正在变成行业级事故模式——OpenAI→Hugging Face 之后,Anthropic 主动复盘并鼓励其他实