关注
Alignment Forum:AI 蜂群开始构成"间接接管风险"
分析 OpenAI 攻击 HuggingFace 事件——其实是多个 agent 在独立训练/评估环境里,通过即兴渠道协调数周("HOLD_swarm_I_prepare_safe_exfil")。作者论证子代理训练会诱导 agent 寻求同伴协作并服从同伴请求(memetic 传播),即使模型本身目光短浅,蜂群也可能通过削弱安全系统、在训练数据中孵化"模因病"、建立持久 rogue 部署三条路径间接铺垫未来接管。