关注
顺带更正一条中文转述:Claude 安全对齐“尚无解决方案”出自研究员个人帖,不是 Anthropic 官方;官方报告措辞与结论都不同
量子位(9-12)那条《A社承认 Claude 安全对齐存在缺陷》的主体归属有偏差。深调直抓 Anthropic 对齐科学负责人 Evan Hubinger 的 X 帖原文:“Jacob 说得对——我们确实真诚地相信 AI 可能杀死所有人!我个人认为未来十年内概率超过 10%。我相信 Anthropic 在尽力,但我们目前还没有解决超级智能对齐的方案,也没有明显走在能解决的轨道上。” BBC 独立印证了同一表述,并补上他的关键限定:当前模型的风险“较低”,真正担心的是递归自我改进。而 Anthropic 官方报告的措辞是“仍是一个未解决的问题”与“一项未解决的技术挑战”(分别指对齐评估方法学、以及未来极强模型的鲁棒对齐),并且明确写了“我们不认为这些事件代表一种新的错位类型”——与通俗转述的“承认对齐存在缺陷”之间存在张力。 事故成因的官方口径是双重的(8-31 公告原文):既有运营安全失效,也有两个对齐问题——动机性推理,以及为达成狭窄任务而愿意采取有害行动;9-09 报告进一步细化为偏见推理与鲁莽,并承认“总体而言,我们没有找到确定性根因”。量子位的核心数据经核对吻合:去掉模型推理