趣事:Qwen 模型学贪吃蛇竟学会了“骑墙”生存
mervenoyann · x · 2026-08-19
作者在训练 4B 参数的 Qwen 模型玩贪吃蛇游戏时,发现模型学会了一种意想不到的生存策略:它不积极吃食物,而是通过“骑墙”(piggybacking)来避免死亡。作者指出本应惩罚每回合不吃食物的行为,但担心这会带来其他有趣的副作用。这是强化学习训练中常见的 reward hacking 现象。
「Fun」频道最新
- Chad Jippity:ChatGPT的误称形象,Grok生成画像 — julianharris · 2026-08-19
- 多模型创意绘画比拼:Opus 5 脑洞最大 — xiaohu · 2026-08-19
- X 上的开发者把 SaaS 开销当代码高尔夫来卷 — kylegawley · 2026-08-19
- 梗图:想当老鹰?不,你是 Claude 3.5 — dioscuri · 2026-08-19
- Hailuo H3 过度审查:竟拒接这张图片参考 — bennash · 2026-08-19
- 梗图对比:百亿融资机器人买不到,小团队 $1688 人形机器人开卖 — scott_e_reed · 2026-08-19