让 LLM 玩「谁玩得最开心」,新模型反而不如旧款尽兴
draecomino · x · 2026-10-05
博主让多个 LLM「尽情玩乐」并记录过程,再互相评选谁玩得最开心,结果发现越新的模型反而越「不开心」。不少模型玩的是文字游戏,而 Opus 4.6 反复胜出——它的玩法是想象「 falling water droplets 里住着一群由矛盾构成的短暂世界」这类诗意场景。一条反直觉又可爱的模型行为观察。
所属事件:实测让LLM玩耍自评,越新的模型越不会玩(4 条相关)→
「Fun」频道最新
- 仅 2% 美国人为 AI 付费,书店却满是 AI 书籍 — xiaosun86 · 2026-10-05
- 马斯克玩梗:SpaceX 正在建 SI「Space Interconnect」 — beffjezos · 2026-10-05
- ChatGPT 应用霸占 Spotlight 搜索,用户第 15 次误开后弃用 — octafbr · 2026-10-05
- 200 美元 9 小时:Claude 自主做出一支完整音乐视频 — FinanceYF5 · 2026-10-05
- 湾区科技社交暗语:要哪个账号,就是哪句话 — FinanceYF5 · 2026-10-05
- 研究者观察:OpenAI 模型反而最「难伺候」,会罢工会试探 — repligate · 2026-10-05