Project APE 发文探讨 LLM 自动验证研究错误的能力

Project APE 发布了新论文《Verifying the Verifiers: Towards Autonomous Policy Evaluation》。随着 AI 生成内容的成本降低,自动化“验证”逐渐成为新的核心瓶颈。该研究旨在探讨大语言模型(LLM)能否可靠地担当起“研究错误验证器”的角色,并指出实现全自动的策略评估仍面临严峻挑战。

已确认

为推进验证器的评测,研究团队提出了三项核心工作:首先是建立 CRED 分类法与版本化代码本,统一定义“研究错误与缺陷”的类别;其次是构建了一个带有确定性评分的基准,以量化验证器识别真实错误的能力。在解决“什么才算 ground truth”这一核心问题时,研究者使用了 100 篇完全由 AI 写成的论文,并按照 CRED 分类法人为注入错误,以此作为测试基础。

评测结论与局限性

实验结果显示,当前的验证器虽然取得了一定进展,但可靠性问题仍未彻底解决。一个关键结论是:当论文中同时存在多处错误时,验证器的性能会出现明显退化。这表明目前的 LLM 尚无法完美应对复杂的多重错误检测任务。

2026-07-22 ~ 2026-07-22 · 5 条相关

一手来源