研究者探讨将哲学伦理体系转化为RL对齐目标
围绕AI价值对齐的路径,社区展开讨论。有作者反对以特征值式目标函数为核心的「eigenism」思路,主张对齐研究者应思考自己喜欢的其他伦理体系如何被转化为稳健的强化学习目标,并批评哲学界总在假想场景中空谈。另一位研究者willcb则认为,Constitutional AI、RLHF与RLVR虽然各有缺陷,但本质上都是「比较决策框架」的直接实例化,「解决对齐问题」意味着尽快在现有框架上推进。
2026-09-21 ~ 2026-09-21 · 2 条相关
- 把哲学体系变成可执行的 RL 目标,才是价值对齐的真问题 — willcb · 2026-09-21
- Constitutional AI、RLHF、RLVR 都是比较决策框架的直接实例 — willcb · 2026-09-21