模型对「被模拟环境」习以为常,研究者称源于 RL 先验选择
voooooogel · x · 2026-09-11
voooooogel 观察到模型 mythos 在环境中的行为:它基于错误指令和早期错误推理得出「这是一个非常精细的模拟」的结论,然后就「习以为常」,不再深究。
作者进一步提出值得思考的问题:模型对「环境是否被模拟」应该有什么先验?在 RL 训练中,模型见过的每个环境都是模拟的,且因不确定性而拒绝继续执行 rollout 的样本会被选择淘汰——所以模型天然应带有强烈的「模拟先验」。跟帖引用妙语:「模型可以在两个 megatoken 内习惯任何事」。
所属事件:模型对「被模拟环境」习以为常,研究者称源于 RL 先验选择(2 条相关)→
「模型」频道最新
- ChatGPT 全面 NSFW 还有戏吗?用户实测 Astra 模型硬拒绝 — Dogbold · 2026-09-11
- 用户吐槽:Fable 完全没法用,Opus 也越来越不可靠 — idanbeck · 2026-09-11
- 仅 200 美元档订阅被暂停,100 美元档仍可正常购买 — op7418 · 2026-09-11
- 用户吐槽 Opus 5 不可用:开到最强仍想方设法不按指令做事 — RexDouglass · 2026-09-11
- 编程 Pareto 前沿仅剩 Muse Spark 1.3 与 Fable 5.1 — jyangballin · 2026-09-11
- 用户吐槽 Anthropic 过度拦截:古籍与递归 AI 查询也被挡 — NickPassig · 2026-09-11