系统性文献综述里别再只看准确率:WMCC 让漏检从 63% 降到 5.8%

Preliminary Guidelines for Using and Evaluating GenAI Tools to Support Systematic Literature Reviews

Barbara Kitchenham, Sebastián Pizard, Lech Madeyski, Ronnie de Souza Santos, Martin Shepperd, David Budgen

cs.SE, cs.AI

2026-07-28

软件工程方法学团队提出 GUEST 指南,指出用准确率评 GenAI 做文献筛选会选错模型;在 9695 篇评测里,按准确率挑最优会漏掉 63.3% 的相关研究,改用 WMCC 只漏 5.8%。

这篇在解决什么

系统性文献综述(SLR,systematic literature review,一种按严格流程穷尽相关文献的研究方法)是软件工程等领域立论的基础。现在越来越多人拿 GenAI 和大模型来辅助筛选、提取、综合,模型确实能概括文本,可综述要求的严谨、可靠、透明,模型并不天然保证。

作者担心的是:大家在用 GenAI 做综述、在评测这些工具时,方法上已经冒出不少毛病。软件工程史上有过前车之鉴,成本估算领域长期把 MMRE 当默认指标,后来被发现是有偏的,却已经成了事实标准。他们不想让 GenAI 综述重蹈覆辙。

方法

这是一篇方法论指南,不是系统评测。做法分两步:先做一次快速综述(rapid review),搜出已提出的 GenAI 综述使用与评测指南;再结合思想实验、文献里已有的方法学指引,以及作者自己做过综述和评测工具的经验,提炼出流程建议,命名为 GUEST(GenAI Use and Evaluation in SLR Tasks)。名字是个比喻:GenAI 工具要像「客人」一样在研究者的监督下贡献,而不是喧宾夺主。

结果

最有分量的证据来自两篇配套实证研究里的一篇筛选评测。在 9695 篇文章的筛选任务上,按不同指标挑「最优模型」,结果天差地别:按准确率挑出的最优模型,漏掉了 63.3% 的相关研究;按普通 MCC 挑的,漏 43.9%;按加权 MCC(WMCC)挑的,只漏 5.8%。三次检索分别召回 13、18 篇已知相关文献,最终整合出 6 条指南(G1 到 G6)。

挑选指标最优模型漏检率
准确率63.3%
普通 MCC43.9%
WMCC5.8%

差距的根源是类别不平衡:相关研究在语料里是极少数,模型只要把所有文章都判成「不相关」就能拿很高的准确率,却把真正该收进综述的研究全漏了。

为什么重要

对要做综述的人,这篇给了一套可操作的流程清单:筛选要用代价敏感的 WMCC 而不是准确率,要报完整混淆矩阵,要防数据污染(测试材料进了模型长期记忆,等于作弊);还要做基线对照、报成本、警惕类别失衡。对评测工具的人,它划清了该怎么独立、可复现地检验这些工具。结论很明确:GenAI 不能脱离人工监督做无监督的系统综述,但能在重复性任务和复杂任务的二次校验上省钱。

局限与存疑

作者自己把这些建议标成「初步」(preliminary),预期会随技术成熟而改。方法是思想实验加经验,不是纯实证,数据提取、偏倚风险评估这些环节的直接证据还不足。整套框架默认学术研究语境,搬到工业界可能水土不服。另外,WMCC 漏检 5.8% 那个数字来自单一筛选研究,样本面有限,不该当成普适结论照搬。

术语

原文与代码

社区讨论

相关论文

全部论文解读