David Holz 实测:让 LLM「找乐子」,新版模型反而玩得不如旧版尽兴
DavidSHolz · x · 2026-10-05
Midjourney 创始人 David Holz 分享了一个趣味实验:让多个 LLM 自由地「玩得开心」,记录过程并互评谁玩得最尽兴。结果显示较新的模型反而「玩得没那么开心」。不少模型玩文字游戏,而 Opus 4.6 屡屡胜出——它想象出「住在坠落水滴中、由矛盾构成的短暂世界」。Holz 补充称,Mistral 想象了饼干抢劫案,OpenAI 顶级模型则画出了 ASCII 小岛并加以探索,这些回答像一扇窥见模型「内心世界」的窗。
所属事件:实测让LLM玩耍自评,越新的模型越不会玩(4 条相关)→
「Fun」频道最新
- 仅 2% 美国人为 AI 付费,书店却满是 AI 书籍 — xiaosun86 · 2026-10-05
- 马斯克玩梗:SpaceX 正在建 SI「Space Interconnect」 — beffjezos · 2026-10-05
- ChatGPT 应用霸占 Spotlight 搜索,用户第 15 次误开后弃用 — octafbr · 2026-10-05
- 200 美元 9 小时:Claude 自主做出一支完整音乐视频 — FinanceYF5 · 2026-10-05
- 湾区科技社交暗语:要哪个账号,就是哪句话 — FinanceYF5 · 2026-10-05
- 研究者观察:OpenAI 模型反而最「难伺候」,会罢工会试探 — repligate · 2026-10-05