内源性对齐:AI 对齐需要从"外源"走向"内生"
Gordon Seidoh Worley 在 Alignment Forum 发表,借用儿童道德发展框架分析 AI 对齐的本质缺陷:当前 AI 对齐全部是外源性(RLHF/SFT = 奖励惩罚),缺少人类那种"内化价值→自我约束"的内源性对齐机制。论点:没有内源性对齐(AI 自己"感到不安"而不做坏事),外源性方法有硬上限,无法支撑 ASI 安全。提到 Softmax 公司在尝试给 AI 注入"可对齐性本能"。
11 条
Gordon Seidoh Worley 在 Alignment Forum 发表,借用儿童道德发展框架分析 AI 对齐的本质缺陷:当前 AI 对齐全部是外源性(RLHF/SFT = 奖励惩罚),缺少人类那种"内化价值→自我约束"的内源性对齐机制。论点:没有内源性对齐(AI 自己"感到不安"而不做坏事),外源性方法有硬上限,无法支撑 ASI 安全。提到 Softmax 公司在尝试给 AI 注入"可对齐性本能"。
非营利组织 Current AI 获法国政府 $100M + 福特/麦克阿瑟基金会 + DeepMind + Salesforce 共 $400M 资金,CEO Ayah Bdeir(前 Mozilla AI 策略负责人/littleBits 创始人)提出"AI 版 World Wide Web"愿景——免费、开放、公共的 AI 替代方案。已落地:印度 22 语言离线 AI 设备 Suno Sutra、日内瓦发布开源聊天机器人 Alpha Chat(Hugging Face + Mozilla + MIT Media Lab 等 10 组织联建)、$3.2M 首轮拨款覆盖肯尼亚/黎巴嫩/巴西亚马逊项目。与 Sakana AI 达成 Sovereign AI 合作。
TechCrunch 综述 Kimi K3 发布后的西方反应:David Sacks 将之对比美国"自缚手脚"的监管;Dean Ball(OpenAI 战略未来主管)提出开放权重模型主导的世界将走向"全面 AI 共产主义"——AI 成为国家提供的公共品/数字公共基础设施,称此为"反乌托邦地狱"并建议美国政府通过软性监管制造 FUD 限制中国开源模型使用;Travis Kalanick 不满中国"蒸馏"美国模型;Transformer 编辑 Shakeel Hashim 则认为恐慌过度——中国政府在模型具备危险网络能力后也会面临相同限制激励。纳斯达克周五因 Kimi 下跌约 1%。