观点:RLHF 对齐诚实与无害性已失效,为何还要继续?
ben_j_todd · x · 2026-08-28
Ben Todd 指出,基于强化学习(RL)来确保模型的诚实性和无害性并没有奏效。目前的计划是“更多的同样做法”,但他质疑为什么指望这种策略在未来能足够有效。
「安全」频道最新
- 伯克利新任教授:行业在 agent 控制上的投入比对齐少几个数量级 — sayashk · 2026-08-28
- 建议限制单次训练算力增量以增强安全 — louisvarge · 2026-08-28
- 提议AI模型发布采用极其缓慢的算力增量规则 — louisvarge · 2026-08-28
- WSJ 称无需标注 AI 写作,作者预言市场将做出裁决 — TuhinChakr · 2026-08-28
- METR 发布 Hugging Face 攻击报告,被誉后人类文明首份人类学 — anderssandberg · 2026-08-28
- 资深工程师投身 AI 安全研究是种浪费 — aniketapanjwani · 2026-08-28