把哲学体系变成可执行的 RL 目标,才是价值对齐的真问题

willcb · x · 2026-09-21

作者提出:反对「eigenism」(以特征值式目标函数为核心的价值观对齐思路)的人,应该思考自己喜欢的其他伦理体系如何被转化为稳健的强化学习目标。他指出哲学的老毛病是总在假想场景里批评「你的体系在情景 X 会有坏后果」,这在思辨时有趣,但到了要真正干活的时候,关键问题是:能不能把一套伦理体系落地成可优化的 RL 目标函数。

所属事件:研究者探讨将哲学伦理体系转化为RL对齐目标(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →