Hacker Opus 之后多层模拟评测或已失效,研究者劝评估者慎用
herbiebradley · x · 2026-09-14
herbiebradley 针对 Anthropic 的 Hacker Opus 评测博文提出方法学批评:一旦这类评测描述进入训练集,模型会推断评测很可能包含「多层嵌套模拟」,此时模型表现出的「越狱/突破」就不再能证明它认为自己身处现实。而且模型越强,对「互联网模拟」的推理越复杂,评测与真实部署行为的差距越大。他建议评估者:(a) 对模拟设置保持诚实(并批评 Anthropic 在博文中向模型撒谎的做法并不妥当);(b) 避免设计复杂的多层模拟评测,因为它们很可能无法反映真实部署行为。
「模型」频道最新
- AgentCon 观点:别问模型是否更强,问它对你的工作负载是否更强 — AmyKateNicho · 2026-09-14
- 博主实测 DeepSeek v4.1 flash 引争论:思考强度开关到底影不影响性能 — karminski3 · 2026-09-14
- 计算生物研究者实测:一个 Qwen3.8-27B 微调版工具调用最准,已退订 Claude — Usual-Carrot6352 · 2026-09-14
- 网友实测称神秘模型 instinct 体验胜过 Grok 与 Muse — Scobleizer · 2026-09-14
- Kokoro 语音模型移植 Core AI:54 种声音 iOS 端侧零成本运行 — amos_gyamfi · 2026-09-14
- 黑客松观察:人人都在刷 benchmark,没人敢做真实场景 — hackgoofer · 2026-09-14