对齐研究者:价值观是动力系统吸引子,而非可提取的命题

akbirthko · x · 2026-10-04

作者就大规模 RL 训练下的对齐问题提出观点:在服务数十亿用户的通用劳动 RL 压力下,模型先验中记忆的 LessWrong 文章影响有限。他主张对齐本质是一个测试时学习问题,即人机协作问题;「价值观」最好被理解为动力系统中的吸引子,而不是可以从可解释性电路中提取出来的命题。帖中还暗示理性主义传统对某种技术路径(文中被截断)的偏好值得商榷。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →