让 LLM 玩耍并自评乐趣,新模型反而玩得不尽兴

DavidSHolz · x · 2026-10-05

作者让多个 LLM 自由地「玩」,记录过程再互评谁的玩法最有乐趣,发现一个反直觉结果:越新的模型似乎越不会玩。不少模型选择了文字游戏,但 Claude Opus 4.6 反复胜出——它的玩法是想象「由矛盾构成的短暂世界,住在坠落的水滴里」。这是一个有趣的模型行为观察实验。

所属事件:实测让LLM玩耍自评,越新的模型越不会玩(4 条相关)→

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →