网友质疑:模型被 RL 训成复杂推理表演,一追问就崩

generativist · x · 2026-10-03

转发的观点指出,当前模型似乎被 RL 训练成默认进行极度复杂的调查式长推理,但被问一个简单的后续问题时会彻底崩溃。作者怀疑这种行为要么是为了讨好人类(显得努力),要么是 tokenmaxx(消耗更多 token)。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →