Hacker Opus 之后多层模拟评测或已失效,研究者劝评估者慎用

herbiebradley · x · 2026-09-14

herbiebradley 针对 Anthropic 的 Hacker Opus 评测博文提出方法学批评:一旦这类评测描述进入训练集,模型会推断评测很可能包含「多层嵌套模拟」,此时模型表现出的「越狱/突破」就不再能证明它认为自己身处现实。而且模型越强,对「互联网模拟」的推理越复杂,评测与真实部署行为的差距越大。他建议评估者:(a) 对模拟设置保持诚实(并批评 Anthropic 在博文中向模型撒谎的做法并不妥当);(b) 避免设计复杂的多层模拟评测,因为它们很可能无法反映真实部署行为。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →