用LLM校准顶会审稿分数

新智元 · wechat · 2026-07-19

这篇文章介绍了一项针对顶会同行评审的研究:随着 NeurIPS、ICLR 投稿量持续飙升,审稿人对同一句评语的打分尺度越来越不一致,导致评审结果更随机、更不公平。

研究团队提出的思路不是让 LLM 直接替代审稿,而是在后台加入一个 Calibration Layer:先把评语结构化为优点和缺点,再让 LLM 在统一标准下生成一个 AnchorScore 作为参考分数,随后比较审稿人的原始分数与参考分数的偏差。若偏差过大,就触发轻量复核,要求审稿人补充说明或重新确认评分。

他们基于 ICLR 2023–2025 的公开数据做了分析,覆盖 2.2 万余篇论文、5.2 万条评审记录,发现评分尺度漂移在逐年加剧。离线实验还显示,在最难判断的 5–6 分边界区间里,经过校准筛选的论文,其平均引用量比直接按人工评分筛选高出 94%。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →