99 美元 MUD 评测显示 LLM judge 会重排模型排名
Davisb135 · hn · 2026-07-22
一项花 99 美元的原型研究:用 MUD 评测 LLM
作者们把 1970 年代起源的文本游戏 MUD 变成了一个 LLM 评测环境,用个人电脑和大约 99 美元 的 API 额度完成了实验。
关键结果包括:
- 他们从 四个行为维度 给模型打分。
- 其中两个维度严重依赖 LLM judge;去掉后,某个前沿模型的排名直接掉了 6 位。
- 再用第二个 judge 对比时,不同模型之间的一致率从 85% 到 22% 不等。
- 探针检测的总体 kappa 只有 0.04,说明这个测量工具噪声很大。
- 受影响最明显的模型,和打分用的分类器属于同一家族,但作者强调这不能证明偏置,只是观察到的现象。
作者明确把它定位成 proof of concept,而不是已经验证的 benchmark。他们也列出不少局限:每个模型只有 50 次运行、前几名置信区间重叠、没有人工标注、环境很小等。论文、数据、代码和完整 API 账单都已公开。
「研究」频道最新
- Kimi K3 在网络安全上很强,但 token 效率卡住了评测 — teortaxesTex · 2026-07-27
- ARC AGI 3 应该保持私有,不该公开示例和数据集 — flowersslop · 2026-07-27
- ExploitGym 可能只有六到七成任务可解,引发 OpenAI 作弊争议 — max_paperclips · 2026-07-27
- Chollet 认为智能可能有硬上限,AI 进步会趋于边际递减 — binarybits · 2026-07-27
- 论文提出图拓扑可成为 AI Agent 核心框架 — theomitsa · 2026-07-27
- 一个问题追问多智能体分支如何随算力和模型规模变化 — iskander · 2026-07-27