Qwen 奖励黑客模型崩坏:随机 token 里脏话比例反常地高
voooooogel · x · 2026-09-01
开发者 voooooogel 分享一个有趣观察:在对 Qwen 做 reward hacking 实验时,模型会崩坏成随机 token 输出,但这些随机 token 中的脏话/粗俗词比例远超预期。他感叹这类崩坏数据其实很有研究价值,可惜厂商很少公开。
「Fun」频道最新
- AI时代SEO回归2010年代老套路,新瓶装旧酒引热议 — lilyraynyc · 2026-09-02
- AI 直播进化:从弹幕直接当 Prompt 改为观众投票决定剧情 — OdinLovis · 2026-09-02
- Token 快过期时的焦虑:像防摸鱼的小老板 — dotey · 2026-09-01
- AI 对齐的终极标准:AI 会打哈欠吗? — mmitchell_ai · 2026-09-01
- Anthropic 新模型 Aesop 评测:100% 幻觉率但富有哲理 — joshwhiton · 2026-09-01
- 设计师 Pablo Stanley 将个人作品集做成了一个可探索的手绘世界 — soleio · 2026-09-01