实测让LLM玩耍自评,越新的模型越不会玩
Midjourney创始人David Holz分享了一项趣味实验:让多个LLM自由地玩耍并记录过程,再互评谁的玩法最有乐趣。结果颇为反直觉——越新的模型反而玩得越不尽兴,多数模型只选择文字游戏,而Claude Opus 4.6反复夺冠,它想象出由矛等元素构成的更富想象力的玩法,展现了模型间趣味创造力的显著差异。
2026-10-05 ~ 2026-10-05 · 4 条相关
- 让 LLM 玩耍并自评乐趣,新模型反而玩得不尽兴 — DavidSHolz · 2026-10-05
- David Holz 实测:让 LLM「找乐子」,新版模型反而玩得不如旧版尽兴 — DavidSHolz · 2026-10-05
- 让 LLM 玩「谁玩得最开心」,新模型反而不如旧款尽兴 — draecomino · 2026-10-05
- 实测让 LLM“找乐子”:越新的模型越不会玩,Opus 4.6 反复夺冠 — Aizkmusic · 2026-10-05