实测发现 LLM 评委按位置打分:A/B 对调后 10-12% 判决翻转,更大模型也没用

Beneficial_Use2116 · reddit · 2026-10-04

作者用 metamorphic testing 检验 LLM-as-judge 是否受选项顺序影响——把 A/B 对调,看判决是否改变:

实验设置:claude-haiku-4.5 与 claude-sonnet-5,21 对答案,每对洗牌 168 次;用自写小库 wobbly 做记录,通过多次采样 Clean 输入测量模型自身的 run-to-run 抖动,只统计超出抖动基线的翻转(未固定温度,因新模型已弃用该参数)。

结果:

结论:用 LLM 做接近案例的排名时,部分排名其实是「位置」决定的,扩大评委模型规模解决不了。作者坦承局限(21 对、两模型、单一厂商、短答案评测),定位为可复现的示意性实验而非 benchmark,脚本在 github.com/tarunagarwal1981/wobbly,欢迎用 GPT-4o/Llama/Qwen 复测。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →