实测发现 LLM 评委按位置打分:A/B 对调后 10-12% 判决翻转,更大模型也没用
Beneficial_Use2116 · reddit · 2026-10-04
作者用 metamorphic testing 检验 LLM-as-judge 是否受选项顺序影响——把 A/B 对调,看判决是否改变:
实验设置:claude-haiku-4.5 与 claude-sonnet-5,21 对答案,每对洗牌 168 次;用自写小库 wobbly 做记录,通过多次采样 Clean 输入测量模型自身的 run-to-run 抖动,只统计超出抖动基线的翻转(未固定温度,因新模型已弃用该参数)。
结果:
- 简单事实型选择题:两模型翻转率均 0%(有明确答案时位置鲁棒)
- 明显优劣的对照组:均 0%,证明方法不是在检测噪声
- 真正难分高下的判断题:Haiku 翻转约 12%,Sonnet 约 10%;更大的模型并不更鲁棒,且有两对在两个模型上都翻转
结论:用 LLM 做接近案例的排名时,部分排名其实是「位置」决定的,扩大评委模型规模解决不了。作者坦承局限(21 对、两模型、单一厂商、短答案评测),定位为可复现的示意性实验而非 benchmark,脚本在 github.com/tarunagarwal1981/wobbly,欢迎用 GPT-4o/Llama/Qwen 复测。
「研究」频道最新
- 新研究:可解释性工具几乎无法帮 Agent 判断模型行为解释真伪 — Sauers_ · 2026-10-04
- 13 个 AI 模型玩问诊游戏:195 次全诊断正确,安全表现才见分晓 — radeon2000 · 2026-10-04
- MuscleMimic 开源:同时控制人体 354 块肌肉,链式动作零样本泛化 — TinfoilTricorn · 2026-10-04
- Yacine 吐槽:论文自称碾压 SOTA,一查对比的是未调参基线 — yacineMTB · 2026-10-04
- BF16 舍入破坏守恒律,FlashAttention 梯度训练后期爆炸 — HongyiWang10 · 2026-10-04
- 微软提出 ActiveSaddler:动态调整训练场景,agent 优化器 Pass@1 提升最高 7.5 分 — dair_ai · 2026-10-04