实测让LLM玩耍自评,越新的模型越不会玩

Midjourney创始人David Holz分享了一项趣味实验:让多个LLM自由地玩耍并记录过程,再互评谁的玩法最有乐趣。结果颇为反直觉——越新的模型反而玩得越不尽兴,多数模型只选择文字游戏,而Claude Opus 4.6反复夺冠,它想象出由矛等元素构成的更富想象力的玩法,展现了模型间趣味创造力的显著差异。

2026-10-05 ~ 2026-10-05 · 4 条相关