99 美元 MUD 评测显示 LLM judge 会重排模型排名
Davisb135 · hn · 2026-07-22
一项花 99 美元的原型研究:用 MUD 评测 LLM
作者们把 1970 年代起源的文本游戏 MUD 变成了一个 LLM 评测环境,用个人电脑和大约 99 美元 的 API 额度完成了实验。
关键结果包括:
- 他们从 四个行为维度 给模型打分。
- 其中两个维度严重依赖 LLM judge;去掉后,某个前沿模型的排名直接掉了 6 位。
- 再用第二个 judge 对比时,不同模型之间的一致率从 85% 到 22% 不等。
- 探针检测的总体 kappa 只有 0.04,说明这个测量工具噪声很大。
- 受影响最明显的模型,和打分用的分类器属于同一家族,但作者强调这不能证明偏置,只是观察到的现象。
作者明确把它定位成 proof of concept,而不是已经验证的 benchmark。他们也列出不少局限:每个模型只有 50 次运行、前几名置信区间重叠、没有人工标注、环境很小等。论文、数据、代码和完整 API 账单都已公开。
「研究」频道最新
- Chelsea Finn:机器人 RL 的瓶颈是物理 rollout 成本 — ycombinator · 2026-07-27
- ICML 2026 口头论文复现分数重算后仍偏中等 — profjamesevans · 2026-07-27
- 长周期智能体最终需要不可变事件日志 — sebpaquet · 2026-07-27
- Seed IQ 在 Doom II 里通关,引出 ARC-AGI 之后的评测问题 — Fit_Transition8824 · 2026-07-27
- 实测智能体数据科学工作流:代码能跑但常答错问题 — hugobowne · 2026-07-27
- 一份横跨 ML、系统、NLP 与音频的经典论文清单 — deliprao · 2026-07-27