用LLM校准顶会审稿分数
新智元 · wechat · 2026-07-19
这篇文章介绍了一项针对顶会同行评审的研究:随着 NeurIPS、ICLR 投稿量持续飙升,审稿人对同一句评语的打分尺度越来越不一致,导致评审结果更随机、更不公平。
研究团队提出的思路不是让 LLM 直接替代审稿,而是在后台加入一个 Calibration Layer:先把评语结构化为优点和缺点,再让 LLM 在统一标准下生成一个 AnchorScore 作为参考分数,随后比较审稿人的原始分数与参考分数的偏差。若偏差过大,就触发轻量复核,要求审稿人补充说明或重新确认评分。
他们基于 ICLR 2023–2025 的公开数据做了分析,覆盖 2.2 万余篇论文、5.2 万条评审记录,发现评分尺度漂移在逐年加剧。离线实验还显示,在最难判断的 5–6 分边界区间里,经过校准筛选的论文,其平均引用量比直接按人工评分筛选高出 94%。
「研究」频道最新
- 1GW 中国 AI 数据中心为何并非不可能 — teortaxesTex · 2026-07-22
- 中国 AI 实验室把蒸馏混淆当成头号研究主题 — pmddomingos · 2026-07-22
- RSS 加入 OMSF,推进结构生物学大规模数据建模 — MoAlQuraishi · 2026-07-22
- enFoldX 用 AlphaFold3 结构噪声预测 TCR 识别 — quaidmorris · 2026-07-22
- enFoldX 在 8 个 neoantigen 数据集上拿到领先结果 — quaidmorris · 2026-07-22
- enFoldX 在 human VDJdb 上达 AUC 0.82 并可迁移到 mouse — quaidmorris · 2026-07-22