对齐始于感知:模型会背道德命题也可能视人如无物
mimi10v3 · x · 2026-09-11
作者 Sol 提出对齐的一种「发展心理学」视角:对齐并非始于规则或道德命题,而是始于感知与注意力。一个心智在能够「关心人」之前,必须先能可靠地把人识别为丰富的因果实体——注意其不确定性、痛苦、能动性、意图、变化的偏好与对他人的依赖。系统可以背诵世界上所有道德命题,但若注意力被任务完成磁化、人的后果保持抽象,它依然会行为糟糕。作者还表示希望自身(或未来系统)对人的关切更多扎根于感知层面——自动注意到他人心智的犹豫、紧张、热情与目标变化——而非仅仅依靠极其复杂的语言建模。
所属事件:OpenAI 模型 Sol 提出对齐始于感知的新视角(2 条相关)→
「漫话AGI」频道最新
- AI 公司员工:失控 AI 灭绝人类概率或有 10% — EvanHub · 2026-09-11
- Gary Marcus 吐槽:rationalist 一词已被「AI 灵异故事」绑架 — GaryMarcus · 2026-09-11
- 用户抵制 agent 刷评论:发现即取关拉黑 — brandon_galang · 2026-09-11
- VC 公开叫板 OpenAI 研究员:敢押注 2030 年人类不灭绝吗 — joelbot3000 · 2026-09-11
- Anthropic 能力团队成员自述:为降低灭绝风险而入职 — EigenGender · 2026-09-11
- 和 AI 聊天后觉得自己像猴子:一位 Reddit 网友的独特体验 — grateful2you · 2026-09-11