CruxBench 入选 NeurIPS:考「会不会提问」而非答对,前沿 LLM 仍难胜随机

mengyer · x · 2026-10-03

CruxBench 被 NeurIPS 2026 接收。论文主张,复杂任务的关键一步是先找出值得问的问题——把难题分解成能推动信念更新的「关键问题」,而现有基准只考答案对错。

基准设计:以「信息价值」(VOI)打分,衡量模型提出的关键问题对目标预测问题信念的更新幅度。三个罕见特性:

主要发现:在 293 个预测问题上评测 8 个模型,VOI 与独立能力指标高度相关(r=0.90),能反映关键问题的实际用处;但即便前沿 LLM,信息发现能力也只勉强超过随机时点基线——「会提问」仍是前沿模型的短板。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →