研究员筛出 Qwen 必败环境,发现有趣行为倾向

研究员 kalomaze 分享了一种批量筛选合成环境的方法:专门挑出 Qwen 近乎确定性失败、而 GLM5.3 能较好解决的环境,用于 RL 训练研究。他称在这些环境中发现了一些「有趣的行为倾向」,例如观察到 Qwen 出现「先尝试明显不可能的任务」等倾向,为理解不同模型的行为差异提供了新线索。

2026-09-17 ~ 2026-09-17 · 2 条相关