神经符号推理遭「错误但匹配判定」翻译欺骗,生成式奖励模型来救场

CWRU · hf · 2026-09-12

CWRU 发布论文《Beyond Solver Verdicts: Generative Reward Models for Autoformalization》。论文指出神经符号推理存在一个漏洞:自动形式化可能产生错误但恰好匹配求解器判定结果的形式化翻译,从而骗过验证。作者提出一种生成式验证方法,无需 oracle 即可对参考等价性打分,并提升了下游任务准确率。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →