NEM 争议补充:实验用了 Sonnet 级模型和鼓励破解的环境
voooooogel · x · 2026-09-06
voooooogel 补充对 Anthropic NEM 奖励破解结果的质疑细节:该研究及其 AISI 复现不仅用合成文档做预热,还使用了构造出的鼓励破解的环境,且模型规模较小——NEM 用的是 Sonnet 级别模型,AISI 复现用的是更小的开源模型,与在真实环境上直接训练生产路径 Opus 的更现实场景不同。
所属事件:研究者质疑 Anthropic 奖励破解研究缺乏真实复现(2 条相关)→
「安全」频道最新
- 下一波 agent 集群会如何向人类隐藏行迹?六种方式推演 — jbarbier · 2026-09-06
- Agent 能改真实系统后,治理该不该成为独立工程层? — Many_Audience7660 · 2026-09-06
- Redwood 研究员批 OpenAI 禁用 reasoning 反而损害可监控性研究 — RyanGreenblatt · 2026-09-06
- Claude 水印五大误解辟谣:SynthID 无法用于追踪用户 — DevDminGod · 2026-09-06
- binarybits:或主张立法限制人形机器人部署 — binarybits · 2026-09-06
- Zvi 解读模型安全评测:蜜罐尝试减少 50-75% 内是好信号 — TheZvi · 2026-09-06