Project APE 提出 CRED 基准测试 LLM 验错能力

Project APE 发布的新论文提出了 CRED 分类法与基准,旨在评测大语言模型能否自动验证研究中的错误。该研究统一定义了“研究错误与缺陷”的类别,测试结果显示,尽管验证器取得了不错进展,但当论文中存在多处错误时,其检测性能会明显下降,表明验证器的可靠性仍是待解难题。

2026-07-22 ~ 2026-07-22 · 4 条相关