幸知日报
← 返回 2026-07-20 日报
重大

内源性对齐:AI 对齐需要从"外源"走向"内生"

Gordon Seidoh Worley 在 Alignment Forum 发表,借用儿童道德发展框架分析 AI 对齐的本质缺陷:当前 AI 对齐全部是外源性(RLHF/SFT = 奖励惩罚),缺少人类那种"内化价值→自我约束"的内源性对齐机制。论点:没有内源性对齐(AI 自己"感到不安"而不做坏事),外源性方法有硬上限,无法支撑 ASI 安全。提到 Softmax 公司在尝试给 AI 注入"可对齐性本能"。