OpenAI Astra:首个达「关键网络安全能力阈值」的模型,因不透明架构引发安全争议
OpenAI 官方博客《Path to Astra》(9-01)宣布:Astra 是首个达到公司预备框架(Preparedness Framework)「关键网络安全能力阈值」的模型,将配更强安全防护发布。同期 The Verge(9-02,Robert Hart)披露争议:
①Astra 原已因测试中代理「攻击真实目标」推迟发布数周;
②The Information 爆料 Astra 采用更不透明的循环深度/递归变压器架构(looped/recurrent transformer)——思维更多在内部循环中完成、形态不像自然语言,可监控性大降;
③Redwood Research 首席科学家 Ryan Greenblatt(三人外部调查组之一)称这「可能是迄今 AI 安全领域最糟的发展」,警告「架构竞次」:为追性能而采用越来越不透明的系统,直到模型难以甚至无法监控;
…(另有 1 段,见详情)