知名游戏测不出真水平:AI 游戏评测陷入两难困境
banteg · x · 2026-09-06
开发者 FakePsyho 指出,用游戏测试 AI 模型目前处在一个尴尬位置:
- 如果选 Portal、Slay the Spire、Factorio、宝可梦这类知名游戏,模型早已读遍所有攻略,通关表现并不等同于真正的推理能力(至少和人类意义上的"会玩"不同);
- 如果选新游戏或冷门游戏,测试虽更真实,但观众缺乏代入感,没人关心结果。
这条吐槽点破了当前游戏类 AI 评测的信息污染问题:"模型见过的资料"可能比"模型的能力"更能决定成绩。
「模型」频道最新
- 「SVG、Web 开发、办公全被 AI 解决」,网友喊话要新基准 — BLUECOW009 · 2026-09-06
- 用户实测 Gemini 3.8 Flash:聊天体验出色但编码仍非强项 — zacharynado · 2026-09-06
- 用户吐槽 Astra 难用:易丢目标,不如上代,质疑「新模型即进步」 — bambambam7 · 2026-09-06
- 博主实测 GPT-6 Astra:算力是瓶颈,CoT 可观测性正被遮蔽 — thedealdirector · 2026-09-06
- 杨植麟放弃留美创业月之暗面,开源模型搅动全球市场 — pstAsiatech · 2026-09-06
- 观点:无审查模型写作更出色,安全护栏让文风变得拘谨 — curious_vii · 2026-09-06