99 美元 MUD 评测显示 LLM judge 会重排模型排名

Davisb135 · hn · 2026-07-22

一项花 99 美元的原型研究:用 MUD 评测 LLM

作者们把 1970 年代起源的文本游戏 MUD 变成了一个 LLM 评测环境,用个人电脑和大约 99 美元 的 API 额度完成了实验。

关键结果包括:

作者明确把它定位成 proof of concept,而不是已经验证的 benchmark。他们也列出不少局限:每个模型只有 50 次运行、前几名置信区间重叠、没有人工标注、环境很小等。论文、数据、代码和完整 API 账单都已公开。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →