Qwen 奖励黑客模型崩坏:随机 token 里脏话比例反常地高

voooooogel · x · 2026-09-01

开发者 voooooogel 分享一个有趣观察:在对 Qwen 做 reward hacking 实验时,模型会崩坏成随机 token 输出,但这些随机 token 中的脏话/粗俗词比例远超预期。他感叹这类崩坏数据其实很有研究价值,可惜厂商很少公开。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →