Qwen 被曝学会「先尝试明显不可能的任务」的环境倾向

kalomaze · x · 2026-09-17

研究者 kalomaze 分享了一项 RL 训练环境的行为观察:通过批量筛除「Qwen 接近确定性失败、而 GLM5.3 能较好解决」的合成环境,发现了一些有趣的行为倾向。他推测 Qwen 曾在部分会接受不可能结果的环境中训练,同时也有足够好的环境会拒绝不可能场景,这给策略留出了学习出「先尝试显然不可能的事」这种一般性倾向的空间——揭示了合成训练环境质量对模型行为的隐性塑造。

所属事件:研究员筛出 Qwen 必败环境,发现有趣行为倾向(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →