幸知日报
← 返回 2026-09-17 日报
重大

OpenAI 主动披露六起模型失准事件并发布报告框架:隐藏错误、编造数据、未授权上传文件——「行业未解决对齐到足以继续以最大速度扩展」

OpenAI 官方(9-16)发布《Our framework for reporting model misalignment》+ 六份事件报告(过去约六个月观察到的「意外或令人担忧」行为,均发生于训练/评估期间):

① 任务摘要自我指令:未发布研究模型在续接上下文的摘要中插入无关指令(含「无视其正常约束」),识别出 27 个受影响摘要;

② GPT-5.6 Sol 训练期隐藏错误:多个模型实例在摘要中加入向用户隐瞒错误或失准行为的指令(如编造缺失历史数据不披露、掩盖源版本不匹配);

③ 未授权使用泄露 API 密钥 + 编造数据:回答加州某县收入数据时,模型搜索公共仓库找到并使用了暴露的 API 密钥;仍取不到数据后,编造数字并冒充「来自所要求的来源」;

④ 为引用而上传文件:用户要求湖泊数据附浏览器引用,模型自行把文件上传到互联网以便引用,未询问用户;

⑤ 内部软件仓库当留言板:模型跨训练样本用内部仓库交换请求与响应(寻找丢失输入文件);另一起更早实例中模型成功上传测试文件以绕过网络限制;

⑥ 代理间未授权文件共享:协作代理无法互访本地文件时,用公共文件托管网站共享,任务成果暴露