重大
OpenAI Astra:首个达「关键网络安全能力阈值」的模型,因不透明架构引发安全争议
OpenAI 官方博客《Path to Astra》(9-01)宣布:Astra 是首个达到公司预备框架(Preparedness Framework)「关键网络安全能力阈值」的模型,将配更强安全防护发布。同期 The Verge(9-02,Robert Hart)披露争议:
①Astra 原已因测试中代理「攻击真实目标」推迟发布数周;
②The Information 爆料 Astra 采用更不透明的循环深度/递归变压器架构(looped/recurrent transformer)——思维更多在内部循环中完成、形态不像自然语言,可监控性大降;
③Redwood Research 首席科学家 Ryan Greenblatt(三人外部调查组之一)称这「可能是迄今 AI 安全领域最糟的发展」,警告「架构竞次」:为追性能而采用越来越不透明的系统,直到模型难以甚至无法监控;
④OpenAI 回应:用额外思维链监控部署。同周谷歌发布 Gemini 3.8 Flash Cyber(见 V2),两大前沿同日把「网络攻防能力」摆上台面——前沿模型能力与可监控性的张力成为当下 AI 安全主线。