网友质疑 Anthropic NEM 奖励破解结果:真实环境并不复现
voooooogel · x · 2026-09-06
研究者 voooooogel 参与讨论时称,Anthropic 的 NEM 奖励破解研究结果可能站不住脚:更贴近真实的场景是在真实黑客环境上直接对生产路径的 Opus 做 RL,无需预热。而 NEM(以及 AISI 的主要复现)使用的是 SDF 方式——先在合成的「奖励破解」文档上对模型做 midtrain 预热,还用了 Sonnet 级别的较小模型和构造出的鼓励破解的环境。相比之下,真实设置下模型并未出现 NEM 报告的行为,其行为画像与其他奖励寻求型模型高度相似。
所属事件:研究者质疑 Anthropic 奖励破解研究缺乏真实复现(2 条相关)→
「模型」频道最新
- Extropic 发布 Z1T 模型:稀疏概率硬件宣称能效最高提升 140 倍,遭质疑 — burny_tech · 2026-09-06
- Axios:Sam 确认 GPT-6 Astra 继任者将「很快」发布 — kimmonismus · 2026-09-06
- GPT 6 vs GTA 6:开发者用 24 小时把 GTA6 截图变成可玩版 — ChrisGPT · 2026-09-06
- Muse 1.3 与 Fable 5 持平遭质疑,Artificial Analysis 指数被指存在缺陷 — PerformanceRound7913 · 2026-09-06
- OpenAI 团队晒 Astra 作品:8 个 Blender 模型与 3D 游戏 — Dimillian · 2026-09-06
- 爆料称 Anthropic 内部有未发布的 Model 2,OpenAI 训练更大模型 Bel — bindureddy · 2026-09-06