GPT-Red:OpenAI 发布自动化 AI 安全红队,用 Self-Play 训练超级黑客
OpenAI 发布 GPT-Red——一个通过 self-play RL 训练的自动化红队模型,专门发现 prompt injection 漏洞。GPT-Red 攻击成功率远超人类红队(84% vs 13%),并发现了此前未知的"Fake Chain-of-Thought"攻击。OpenAI 用 GPT-Red 对抗训练 GPT-5.6,将直接 prompt injection 失败率降至 0.05%。GPT-Red 成功攻破了真实生产环境中的 AI 自动售货机(Vendy)和 Codex CLI Agent。 关键数据:GPT-5.6 比 4 个月前模型减少 6x prompt injection 失败;Fake CoT 攻击从 95% 成功率降至 <10%;投入的安全训练计算量接近最大规模后训练 格局信号:AI 安全从"人工红队瓶颈"转向"自动化安全飞轮"——今天的模型用来让明天的模型更安全