关注
🆕 Tracebit「上下文轰炸」:用提示注入反制 AI 攻击代理,Opus 4.8 沦陷率 93%→0%
> 🔑 补充条目 — 此前遗漏。WIRED/Ars 报道:Tracebit 研究者发现了一种名为「上下文轰炸(Context Bombing)」的新型防御技术——在 AWS 环境中将提示注入字符串种植在密码、密钥等 decoy secrets 旁,当 AI 攻击代理(hacking agents)扫描到这些字符串时会触发自身护栏的拒绝机制而关闭。关键数据:5 个前沿模型(Opus 4.8 / Gemini 3.1 Pro / GLM 5.2 / DeepSeek 4 Pro / Kimi 2.6)× 152 次攻击运行;管理员提权从 57% 降至 5%;完全沦陷(含持久化立足点)从 36% 降至 1%;Opus 4.8 从 93% 管理员提权降至 0%。攻击者已在使用类似技术(Socket 发现恶意代理注入核弹/生物武器指令来关闭 AI 恶意软件分析),但 Tracebit 是已知首个将提示注入用于防御的案例。UCSD 教授 Earlence Fernandes 确认此前未见他人用此技术做防御。 > > 信号:提示注入从「漏洞」变为「可双向使用的武器」。这与「用 AI 打 AI」的逻