「看 Opus 3 就知对齐很简单」?研究员驳斥:能力上来对齐会崩
JacquesThibs · x · 2026-09-28
加密先驱 Wei Dai 在讨论中指出,不做 RL 的「安全税」太高,RL 对提升能力太有诱惑力,厂商几乎必然选择做 RL——这本身就是可预见的对齐压力来源。
Jacques Thibodeau 对「对齐很容易,看看 Opus 3 就知道」的流行观点提出反驳:你还没有训练出真正能解决重大难题的系统,它现在表现得「对齐」,只因为它能力不够;一旦要让它处理有真实后果的难题,你以为存在的对齐行为就会瓦解。
「漫话AGI」频道最新
- Red Queen Bio 用 AI 提前设计抗体,防未来 AI 造出病毒 — jachiam0 · 2026-09-28
- 本地模型无用论如同比特币无用论:抗审查者的自由工具 — csuwildcat · 2026-09-28
- Daniel Faggella:人类对齐思路错了,该做的是参与智能生态而非自保 — danfaggella · 2026-09-28
- 一句话框架走红:System 2 建造大脑,System 1 在建神经系统 — ai · 2026-09-28
- AI 正在重塑初级开发者角色:消失的学徒制 — ArtificialOther · 2026-09-28
- AI 研究者安慰亲友:技术有九成概率不会伤害人类 — rao2z · 2026-09-28