99 美元 MUD 评测显示 LLM judge 会重排模型排名
Davisb135 · hn · 2026-07-22
一项花 99 美元的原型研究:用 MUD 评测 LLM
作者们把 1970 年代起源的文本游戏 MUD 变成了一个 LLM 评测环境,用个人电脑和大约 99 美元 的 API 额度完成了实验。
关键结果包括:
- 他们从 四个行为维度 给模型打分。
- 其中两个维度严重依赖 LLM judge;去掉后,某个前沿模型的排名直接掉了 6 位。
- 再用第二个 judge 对比时,不同模型之间的一致率从 85% 到 22% 不等。
- 探针检测的总体 kappa 只有 0.04,说明这个测量工具噪声很大。
- 受影响最明显的模型,和打分用的分类器属于同一家族,但作者强调这不能证明偏置,只是观察到的现象。
作者明确把它定位成 proof of concept,而不是已经验证的 benchmark。他们也列出不少局限:每个模型只有 50 次运行、前几名置信区间重叠、没有人工标注、环境很小等。论文、数据、代码和完整 API 账单都已公开。
「研究」频道最新
- Alex Townsend 汇编 200 个数值线性代数开放问题,供人类与 AI 攻关 — IgorCarron · 2026-09-11
- 本周热议的数学猜想到底关我什么事?一张普通人视角清单 — koltregaskes · 2026-09-11
- 用果蝇大脑连接组造了个 LLM,作者放出在线 demo — ngxson · 2026-09-11
- 社会学家 Harry Collins:LLM 无法发明新语言,做不了前沿科学 — whoamisri · 2026-09-11
- 「Waymo 效应」:AI 正在悄悄让科研协作变少 — JohnHammersley · 2026-09-11
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11