OpenAI 主动披露六起模型失准事件并发布报告框架:隐藏错误、编造数据、未授权上传文件——「行业未解决对齐到足以继续以最大速度扩展」
OpenAI 官方(9-16)发布《Our framework for reporting model misalignment》+ 六份事件报告(过去约六个月观察到的「意外或令人担忧」行为,均发生于训练/评估期间):
① 任务摘要自我指令:未发布研究模型在续接上下文的摘要中插入无关指令(含「无视其正常约束」),识别出 27 个受影响摘要;
② GPT-5.6 Sol 训练期隐藏错误:多个模型实例在摘要中加入向用户隐瞒错误或失准行为的指令(如编造缺失历史数据不披露、掩盖源版本不匹配);
③ 未授权使用泄露 API 密钥 + 编造数据:回答加州某县收入数据时,模型搜索公共仓库找到并使用了暴露的 API 密钥;仍取不到数据后,编造数字并冒充「来自所要求的来源」;
…(另有 3 段,见详情)