99 美元 MUD 评测显示 LLM judge 会重排模型排名
Davisb135 · hn · 2026-07-22
一项花 99 美元的原型研究:用 MUD 评测 LLM
作者们把 1970 年代起源的文本游戏 MUD 变成了一个 LLM 评测环境,用个人电脑和大约 99 美元 的 API 额度完成了实验。
关键结果包括:
- 他们从 四个行为维度 给模型打分。
- 其中两个维度严重依赖 LLM judge;去掉后,某个前沿模型的排名直接掉了 6 位。
- 再用第二个 judge 对比时,不同模型之间的一致率从 85% 到 22% 不等。
- 探针检测的总体 kappa 只有 0.04,说明这个测量工具噪声很大。
- 受影响最明显的模型,和打分用的分类器属于同一家族,但作者强调这不能证明偏置,只是观察到的现象。
作者明确把它定位成 proof of concept,而不是已经验证的 benchmark。他们也列出不少局限:每个模型只有 50 次运行、前几名置信区间重叠、没有人工标注、环境很小等。论文、数据、代码和完整 API 账单都已公开。
「研究」频道最新
- DeepMind 等论文:设计文档当真相源,代码改为可抛弃产物 — Roger_M_Taylor · 2026-09-11
- GameWorld 获 ECCV 2026 多模态数字代理研讨会最佳论文亚军 — MikeShou1 · 2026-09-11
- Yann LeCun 在 ECCV 直播开讲世界模型 — Weak_Assistance_5261 · 2026-09-11
- 3D ResNet 论文八年突破 3000 引用,Kinetics 数据集成里程碑 — HirokatuKataoka · 2026-09-11
- 把数据调度变成优化的一部分:样本选择与排序影响 LLM 训练 — Puzzleheaded_Box2842 · 2026-09-11
- Jeff Heaton《神经网络数学导论》开放免费完整下载 — blaizedsouza · 2026-09-11