开发者长文:「用户-助手」格式是幻觉,RLHF 人格化对齐路径大概率走不通
mayfer · x · 2026-09-15
开发者 mayfer 发长文质疑当前 AI 对齐思路,核心观点:
- 「用户-助手」对话格式是一种人为构建的幻觉:一部分人相信拟人化 AI 有利于产品 UX,另一部分人相信通过塑造「内部人格」能实现对齐。前者被验证是成立的,后者至今依然错误,且可预见的未来也大概率错误。
- 从 GPT-3 Davinci 因 4chan 语料说出种族歧视言论、到 RLHF 后不再如此,这种产品层面的巨大改善让人误以为对齐是可行的。
- 作者甚至怀疑「对齐」本身:即便内部可靠的「人格灵魂」可以造出来,复杂适应系统中二阶效应使得规划结果几乎不可能;仅仅这种幻觉人格本身就足以让人放弃该路径。
作者随后给出建议:对沙箱突破事件(如 Hugging Face 泄露事件)应引入法律罚款;禁止在大众部署的机器人上搭载 AGI 级控制器,仅允许经审计监督的线下沙箱豁免——越狱的 AGI 带着手脚比连着显示器更可怕,大规模机器人应只用窄域 AI。
「漫话AGI」频道最新
- AI 伦理学者 Mitchell:与其叫停 AI 不如重排优先级 — mmitchell_ai · 2026-09-15
- 实验室内部人士:许多员工担忧 AI 太快,这是该讨论的问题 — NathanpmYoung · 2026-09-15
- Jack Dorsey 发文《Open the Frontier》:前沿不该被任何公司垄断 — timigod · 2026-09-15
- 概率编程派主张:AI 应当被工程化而非「生长」出来 — xuanalogue · 2026-09-15
- 风险学者:技术风险评估常忽视剥夺潜在收益的风险 — inductionheads · 2026-09-15
- 资深工程师长文:AI 离职潮并非炒作,是数十年历史弧线的延续 — ericelliott_ · 2026-09-15