2026-07-29
OpenReviewer 用 7.9 万条真实评审微调 Llama-3.1-8B 专写论文评审;推荐分贴近人类(5.4,GPT-4o 高到 7.7),400 篇测试精确匹配 55.5%。
大模型其实早就能给论文写评审,但写得「太客气」。已有研究反复观察到:GPT-4 这类通用模型倾向于报喜不报忧,给的推荐分系统性偏高,把改稿子当成哄作者开心。对想在投稿前拿到实在反馈的作者来说,这种一律好评的评审没什么用,反而可能让人误判自己稿子的真实处境。
OpenReviewer 想解决的就是这个偏差:专门训练一个模型,让它给出的评审在批评力度和打分分布上都接近真实的人类评审。定位是投稿前的自助反馈工具,明确不打算取代人类同行评审。
核心是 Llama-OpenReviewer-8B,在 Llama-3.1-8B-Instruct 上做全参微调。训练数据从 OpenReview 抓了 ICLR 和 NeurIPS(2022 年起)约 3.6 万篇论文和 14.1 万条评审,只保留置信度较高的,最后筛出约 7.9 万条。论文用 Marker 把 PDF 转成 markdown(含公式和表格),只留正文和参考文献,丢掉附录。
微调细节也实在:3 个 epoch,有效 batch size 64,学习率 2e-5,序列长度拉到 128k 以容纳整篇论文,bf16 精度,64 张 A100 80GB 跑了约 34 小时。系统提示词借鉴 ICLR 2024 的评审指南,规定输出 markdown、按可配置模板分节;用户提示极简,只有一句「Review the following paper:」加全文。整个系统是个 HuggingFace Spaces 上的 Gradio demo,上传 PDF 自动转 markdown,点一下生成,流式输出评审。
在 400 篇 NeurIPS 2024 加 ICLR 2025 的测试集上(挑最近两届避免数据泄漏),和四个通用模型对比。推荐分统一归一到 1(强拒)到 10(强收):
| 模型 | 精确匹配率(命中至少一位人类评审) | 平均推荐分 |
| Llama-3.1-8B | 14.0% | 8.1 |
| Claude-3.5-Sonnet | 15.5% | 7.6 |
| GPT-4o | 23.8% | 7.7 |
| OpenReviewer | 55.5% | 5.4 |
人类评审的平均推荐分也是 5.4,和 OpenReviewer 完全一致;通用模型普遍在 6.9 到 8.1,Llama-3.1-8B 高到 8.1,相当于给大多数论文打接收。推荐分的平均绝对误差,OpenReviewer 是 0.96,GPT-4o 是 2.34。在一个用 GPT-4o 当裁判的偏好对决里,OpenReviewer 对四个对手的胜率从 60%(对 GPT-4o)到 76%(对 Llama-3.1-70B)。
一个 8B 小模型在评审这项任务上盖过了大它几倍的通用模型,靠的不是体量,是专门微调。
这篇给的最直接结论是:在评审这种有明确领域规范的任务上,专门微调比单纯堆大模型更管用。对个人作者,它是一个免费的、投稿前能快速拿到结构化批评的工具,模型和 demo 都开源;对做 LLM 应用的人,它是一个用领域数据纠正通用模型偏置的干净案例,说明小模型加对的数据能在窄任务上反超大模型。
它的适用面很窄:训练数据只来自机器学习领域的两个会议,换到别的学科或别的会议模板,效果会打折。
作者自己列了一串局限。数据上只有 ICLR 和 NeurIPS 2022 年起的论文,领域单一,而且部分用了去匿名版本,可能有信息泄漏。技术上依赖 PDF 转 markdown 的质量(用的是 Marker),图表和图片处理是弱项;模型只有 8B,文档理解能力不及更大的模型。评测上测试集只有 400 篇(受商业模型调用成本限制),主要靠自动指标,没有细致的人工分析,基线也只选了几个。
评测的前提也得追问。论文默认「和人类评审相似就等于质量高」,但人类评审本身质量控制有限、还带着各种偏置;用 GPT-4o 当裁判去比谁更像人类评审,等于让一个已知偏正面的模型来判优劣,这个裁判的可信度作者没有充分讨论。OpenReviewer 推荐分和人类均值完全一致,都是 5.4,漂亮得有点过头,也可能只是反映它学会了回归到训练集的均值,而不是真的逐篇判断。