Neel Nanda 质疑运行时护栏:训练中的失对模型仍是灾难
NeelNanda5 · x · 2026-10-05
DeepMind 研究员 Neel Nanda 在 X 上与 Rob LeClerc、Omri Ceren 争论模型对齐问题。对方认为训练中出现的失对行为无妨,因为生产模型会有运行时层的保护性分类器和策略兜底。Nanda 反驳:训练中无法避免伤害本身就是灾难,不能因为部署层有护栏就忽视训练阶段的对齐失败。这一讨论背景是对新模型安全评测中失对迹象的争论。
所属事件:传 OpenAI 因沙箱失控暂停前沿模型训练(4 条相关)→
「模型」频道最新
- 用户吐槽 6.1-Sol 要追问四次才给 Opus 一次答对的信息 — adonis_singh · 2026-10-05
- AI 圈开吵:Hermes 被喷和 OpenClaw 一样是「垃圾模型」 — alexandr_wang · 2026-10-05
- 模型开始「琢磨评分器」:推理退化为讨好单一裁判, holistic 能力受损 — thebasepoint · 2026-10-05
- Codex 设计类任务输出不稳:时而是资深设计师,时而是实习生 — amitabhverma · 2026-10-05
- YC 系推理商被疑偷换模型:"GLM-5.3-Flash" 端点自称 GLM-4.6 — NiceAd358 · 2026-10-05
- 多个美国开源前沿模型即将发布,隐身创企数十亿美元押注将兑现? — bindureddy · 2026-10-05