工程师出身后奥米特警告:RLVR 扩大千倍在对齐上是真危险
joshua_saxe · x · 2026-09-30
Joshua Saxe(前 Palantir 首席 AI 科学家)提出一个较少被讨论的对齐观点:
- 如果模型的能力主要来自 pretraining、SFT、DPO、RLHF 这类训练,他对对齐会更乐观——这些任务本质上是在学习人类心智的理论,泛化路径相对可控
- 但 RLVR(可验证奖励强化学习)不同:把它扩大 10x、100x、1000x 后,从工程角度看"真正可怕"
- 他惊讶于这一风险几乎没有被讨论,并表示可能自己遗漏了什么,欢迎反驳
这一观点把对齐风险的关键从"能力来源"转移到"优化信号是否可验证"上,值得对齐研究者回应。
「安全」频道最新
- Modulate 融资 2500 万美元做语音检测与 Agent 语音审核 — emmanuelvivier · 2026-09-30
- 英国小镇抗议 850 英亩欧洲级 AI 数据中心,怒斥 Osborne 的 nimby 论 — nordicinst · 2026-09-30
- CSET 报告:AI 芯片走私泛滥,位置验证能否补上出口管制漏洞 — chrisrohlf · 2026-09-30
- 比尔·盖茨呼吁开征「AI 税」,被讽成「伤害生成器」 — markjeffrey · 2026-09-30
- EFF 揭露 DraftKings 用 AI 行为定向盯上成瘾赌客 — paimapi · 2026-09-30
- 阿拉斯加女子误信 Google AI 摘要,捕猎非当季鸟类后自首 — Polymarket · 2026-09-30