重大
Alignment Forum:内源性对齐(Endogenous Alignment)——AI 对齐的终极路径
Gordon Seidoh Worley(AI 安全研究者)7月18日在 Alignment Forum 发表长文。核心论证:当前 AI 对齐方法(RLHF/SFT)属于「外源性对齐」——类似训儿童的外部奖惩机制,无法产生真正的自我约束动机。真正的安全需要「内源性对齐」——AI 因恐惧/羞耻/内疚等情感驱动自我保持对齐,最终达到与人类价值观的内在和谐。当前 AI 缺乏进化赋予人类的「可对齐本能」(求生/求爱/求认可),这构成对齐天花板。Softmax 公司正在尝试赋予 AI 此类本能。文章认为内源性对齐是安全构建超级智能的必要条件。