让 LLM 玩乐并互评:新模型玩得越来越不开心

eliebakouch · x · 2026-10-06

David Holz 发起了一个趣味实验:让各家 LLM「尽情玩乐」并写下经过,再互相评分谁玩得最开心。结果显示越新的模型似乎越不会玩了。不少模型玩文字游戏,而 Opus 4.6 反复胜出——它靠想象「住在正在下落的水滴里的矛盾生物」这类自相矛盾的微型世界获胜。后续讨论中 eliebakouch 指出评分与报告长度高度相关,Holz 回应称短篇也可能真的写得差。

所属事件:David Holz 让 LLM 自由玩耍,Opus 4.6 夺冠(7 条相关)→

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →