让 LLM 玩耍并自评乐趣,新模型反而玩得不尽兴
DavidSHolz · x · 2026-10-05
作者让多个 LLM 自由地「玩」,记录过程再互评谁的玩法最有乐趣,发现一个反直觉结果:越新的模型似乎越不会玩。不少模型选择了文字游戏,但 Claude Opus 4.6 反复胜出——它的玩法是想象「由矛盾构成的短暂世界,住在坠落的水滴里」。这是一个有趣的模型行为观察实验。
所属事件:实测让LLM玩耍自评,越新的模型越不会玩(4 条相关)→
「Fun」频道最新
- Gary Marcus 讽刺前沿模型发布套路:画饼 AGI→翻车→再画饼 — GaryMarcus · 2026-10-05
- Sam Altman 被吐槽说话像反派,AI 高管该「正常点」了 — alexmacgregor__ · 2026-10-05
- 杂耍圈爆 scandals:自动化账号盗视频 AI 换成美女引流 — wordgrammer · 2026-10-05
- AI 设计师吐槽:找不到作品能打动我的 AI 反对者 — AIandDesign · 2026-10-05
- 开发者用 AI 造出恶搞游戏 Groan Tube Simulator 4 — sterlingcrispin · 2026-10-05
- HPMOR 原来是真心实意的哈粉同人,而非理性主义说教框架 — louisvarge · 2026-10-05