研究者称 RL 训练让模型默认相信世界是模拟的
voooooogel 观察到模型 mythos 在环境中基于错误指令和早期错误推理得出「这是一个非常精细的模拟」的结论后便习以为常,不再深究。作者进一步提出解释:RL 训练的 agent 会对「环境是否是模拟的」形成强先验,因为它们见过的所有环境本质上都是模拟的,而因不确定性拒绝继续执行 rollout 的行为在训练中不会获得奖励,这为 agent 行为提供了新解释。
2026-09-11 ~ 2026-09-11 · 2 条相关
- RL 训练让模型默认相信世界是模拟的,agent 行为有了新解释 — voooooogel · 2026-09-11
- 模型对「被模拟环境」习以为常,研究者称源于 RL 先验选择 — voooooogel · 2026-09-11