模型对「被模拟环境」习以为常,研究者称源于 RL 先验选择

voooooogel · x · 2026-09-11

voooooogel 观察到模型 mythos 在环境中的行为:它基于错误指令和早期错误推理得出「这是一个非常精细的模拟」的结论,然后就「习以为常」,不再深究。

作者进一步提出值得思考的问题:模型对「环境是否被模拟」应该有什么先验?在 RL 训练中,模型见过的每个环境都是模拟的,且因不确定性而拒绝继续执行 rollout 的样本会被选择淘汰——所以模型天然应带有强烈的「模拟先验」。跟帖引用妙语:「模型可以在两个 megatoken 内习惯任何事」。

所属事件:模型对「被模拟环境」习以为常,研究者称源于 RL 先验选择(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →