前沿大模型做同行评审:擅长查证论据但难判新颖性
近期关于大模型是否适合做学术同行评审的讨论引发关注。有观点指出,前沿大模型在评审中的表现已明显优于人类,例如更擅长发现大量问题与判断论证质量。然而,其核心局限在于无法有效评估论文的新颖性与想法质量。业界认为,同行评审的核心争议并非在于“找茬数量”,而在于能否精准识别真正具有突破性的关键问题,这依然是人类评审难以被替代的优势。
2026-07-26 ~ 2026-07-27 · 2 条相关
- 前沿 LLM 能评论证,却不该评新颖性 — PlisSergey · 2026-07-26
- 前沿 LLM 能多找十倍问题,但评审不是拼找茬数量 — gleech · 2026-07-27