S Lazar 深入批驳对齐不可解论:RL 正在让模型学会道德思辨
sethlazar · x · 2026-09-13
在辩论第二轮,Seth Lazar 读完原文后指出 Matt Lutz 的实际论证比标题假设的更不可信。
- Lutz 的真实论据是情感主义(sentimentalism)式的两难,Lazar 认为这是一个有争议的哲学立场,支持与反对的理由同样多,且现有对 LLM 的道德理解本身就是反对它的证据。
- 针对「RL 只是奖惩教好坏」的论点,Lazar 认为被严重简化:RL 不只是用奖励惩罚教模型区分好坏行为,而是在教模型真正进行更好的道德思辨。
- 他承认这可能仍落入「错误理由」问题,但这无法先验裁定;迄今的证据是道德推理能力可以改进,随之对齐也能改进。结论:对齐确实难,但原文给出的理由站不住。
「漫话AGI」频道最新
- 网友指 Anthropic 与 OpenAI 借安全之名打造合法卡特尔 — AlexTensor · 2026-09-13
- 放射科 AI 争议引思考:别用梗图思维否认 AI 将重塑职业结构 — AndyMasley · 2026-09-13
- 西西弗斯新解:AI 不解放人类,而是迫使我们自己定义「山峰」 — YogeshMalik · 2026-09-13
- Yishan 力挺 Dario/Sama 降速主张:中国同样在意防范人类灭绝 — yi_ding · 2026-09-13
- 英国数据显示 AI 正在冲击计算机专业毕业生就业前景 — Visible_Vacation3308 · 2026-09-13
- 网络安全专家:红蓝 AI 并非互相抵消,防御存在理论极限 — joshua_saxe · 2026-09-13