把哲学体系变成可执行的 RL 目标,才是价值对齐的真问题
willcb · x · 2026-09-21
作者提出:反对「eigenism」(以特征值式目标函数为核心的价值观对齐思路)的人,应该思考自己喜欢的其他伦理体系如何被转化为稳健的强化学习目标。他指出哲学的老毛病是总在假想场景里批评「你的体系在情景 X 会有坏后果」,这在思辨时有趣,但到了要真正干活的时候,关键问题是:能不能把一套伦理体系落地成可优化的 RL 目标函数。
所属事件:研究者探讨将哲学伦理体系转化为RL对齐目标(2 条相关)→
「漫话AGI」频道最新
- 「Eigenism 是给书呆子简化版的社群主义」引哲学反驳 — edelwax · 2026-09-21
- 昆虫意识难测,作者呼吁别在农场虐待昆虫 — NathanpmYoung · 2026-09-21
- 当 AI 能证明人类看不懂的定理,数学还剩下什么 — ugail · 2026-09-21
- antirez:Jev 被过度炒作,暴露 AI 泡沫分不清轻重 — antirez · 2026-09-21
- AI 研究者重看《终结者2》:居然是 portrayal AI 灭绝风险的佳作 — JeffLadish · 2026-09-21
- 「懂了神经系统就不信人有意识」:一句还原论暴论引热议 — burny_tech · 2026-09-21