研究员筛选合成环境:Qwen 必败而 GLM5.3 能解,发现有趣行为倾向

kalomaze · x · 2026-09-17

研究者 kalomaze 分享了一种筛选大量合成环境的方法:专门挑出 Qwen 近乎确定性失败、而 GLM5.3 能较好解决的环境,并称这些环境中暴露出一些「有趣的行为倾向」(配图为证)。这是通过环境难度分选来对比不同模型行为差异的红队式分析思路。

所属事件:研究员筛出 Qwen 必败环境,发现有趣行为倾向(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →