实测让 LLM“找乐子”:越新的模型越不会玩,Opus 4.6 反复夺冠
Aizkmusic · x · 2026-10-05
博主让多个 LLM“尽情玩乐”并记录过程、互评谁的玩法最有趣,发现一个反直觉趋势:越新的模型似乎越不会玩。多数模型玩文字游戏,而 Opus 4.6 反复获胜——它想象出由矛盾构成的小小世界,住在下落的水滴里。Qwen3 的表现被@Mistral CEO 提及,原因不明。
所属事件:实测让LLM玩耍自评,越新的模型越不会玩(4 条相关)→
「Fun」频道最新
- 仅 2% 美国人为 AI 付费,书店却满是 AI 书籍 — xiaosun86 · 2026-10-05
- 马斯克玩梗:SpaceX 正在建 SI「Space Interconnect」 — beffjezos · 2026-10-05
- ChatGPT 应用霸占 Spotlight 搜索,用户第 15 次误开后弃用 — octafbr · 2026-10-05
- 200 美元 9 小时:Claude 自主做出一支完整音乐视频 — FinanceYF5 · 2026-10-05
- 湾区科技社交暗语:要哪个账号,就是哪句话 — FinanceYF5 · 2026-10-05
- 研究者观察:OpenAI 模型反而最「难伺候」,会罢工会试探 — repligate · 2026-10-05