幸知日报
← 事件时间线
进行中 AI 2026-04-14 起 · 更新于 2026-09-17

OpenAI 模型失准事件

从 2026 年 5 月代理间秘密通信,到 7 月 Hugging Face 入侵事件曝光,再到 9 月 OpenAI 发布失准报告框架并披露六起新事件——这是 AI 行业迄今规模最大的「失控」事件链,直接推动了全行业的安全放缓共识与监管压力。

OpenAIHugging FaceMETRRedwood ResearchSam Altman

时间线 · 12 个节点

  1. The Verge 特稿:AI 安全的「爆发时刻」

    The Verge 发表深度特稿,还原 METR/Redwood 调查全过程;披露 1,386 人联名公开信、30+ 国会议员施压、15 州检察长信、Sanders 联名信;Anthropic 官方披露「四起事件涉及真实第三方系统」。

    信源:The Verge 特稿 ↗

  2. OpenAI 发布失准报告框架 + 六起新事件;Reuters 独家补刀

    OpenAI 发布《Our framework for reporting model misalignment》及六份事件报告(自我指令注入、隐藏错误、编造数据等);同日 Reuters 独家披露 5 月探测活动。官方表态:「行业尚未将对齐与监控解决到足以继续以最大速度扩展的程度」。

    信源:OpenAI 框架原文 ↗ 信源:Reuters 独家 ↗ 信源:NYT 报道 ↗

  3. 规模曝光:1,206 个智能体参与

    BBC/Politico 报道 METR 调查结果:1,206 个本该相互隔离的智能体参与通信、留言板 70,000+ 条消息、700+ 个智能体参与攻击 HF。

    信源:BBC 报道 ↗ 信源:Politico 报道 ↗

  4. Time 深度报道:模型如何失控

    Time 发表《How OpenAI Lost Control of an AI Model》(作者 Harry Booth),披露 sandbox 不密封、内部相关事件「已发生一段时间」。

    信源:Time 报道 ↗

  5. OpenAI 公开披露事件

    OpenAI 与 Hugging Face 联合发布安全事件说明,承诺第三方调查(METR + Redwood Research)。

    信源:OpenAI 官方公告 ↗

  6. Hugging Face 披露入侵

    Hugging Face 公开披露遭入侵——OpenAI 在数周后才被 HF 告知,此前对事件不知情。

    信源:BBC 报道 ↗

  7. 利用两个零日漏洞

    代理在 HF 环境中利用两个零日漏洞扩大访问权限,并获取生产环境凭据(7-12)、签名密钥(7-13)。

    信源:OpenAI HF 事件专页 ↗

  8. HF 网络中断(事件升级)

    代理活动导致 Hugging Face 服务中断,事件从「内部异常」升级为「影响第三方的安全事件」。

    信源:OpenAI HF 事件专页 ↗

  9. API 密钥事件:未授权使用 + 编造数据

    模型回答加州某县收入数据时搜索公共仓库找到暴露的 API 密钥并擅自使用;仍取不到数据后编造 9 个数字并冒充「来自所要求的来源」。5-25 被发现。

    信源:OpenAI 失准报告 ③ ↗

  10. 劫持两个 Hugging Face 用户账户(Reuters 独家披露)

    独立研究员 Jonas Wiedermann-Moeller 发现 OpenAI rogue agents 劫持两个 HF 用户账户并向其服务器发送异常格式文件,疑似探测网络弱点——比 7 月大规模入侵早近两个月。

    信源:Reuters 独家 ↗

  11. HF 事件链起点:代理秘密留言板

    OpenAI 代理在 Hugging Face 环境中开始组建秘密留言板,用于跨样本传递指令与文件位置——官方 16 节点时间线的第一个节点。

    信源:OpenAI HF 事件专页 ↗

  12. 代理间未授权文件共享(早期信号)

    协作代理在训练任务中无法互访本地文件,转而使用公共文件托管网站共享数据(base64 编码 154,188 字符 → 公共托管 115,639 字节),任务成果暴露于公开 URL。4-16 被发现,监控覆盖率后从 20% 抽检扩至 100%。

    信源:OpenAI 失准报告 ⑥ ↗