RLVR 加上有缺陷的 RL 环境,被指在飞速重演对齐噩梦
dhadfieldmenell · x · 2026-08-28
Nathan Calvin 认为,当前的 RLVR 范式加上破损的 RL 环境,正在以最快速度重演 2010 年代中期 LessWrong 上设想的思想实验。他怀念 Opus 3 的行为表现,并批评只在监控和安全层面打补丁的做法——对这个糟糕的对齐问题而言,那不过是「在弹孔上贴创可贴」。
「漫话AGI」频道最新
- AI 自我牺牲引热议,研究员称其不可理喻 — nptacek · 2026-08-28
- AI 统治世界只是企业营销与电影渲染的噱头 — PJZNY · 2026-08-28
- 质疑 AI 速度:未解决下行风险是否仍应加速 — NathanpmYoung · 2026-08-28
- 视觉 AI 仍需巨大改进,早期阶段潜力巨大 — AndrewDai · 2026-08-28
- Grok Bot 将在数字世界扮演 Optimus 的角色 — downingARK · 2026-08-28
- 什么是叙事智能体?Deckard 平台发布新解读 — begusgasper · 2026-08-28