CruxBench 入选 NeurIPS:考「会不会提问」而非答对,前沿 LLM 仍难胜随机
mengyer · x · 2026-10-03
CruxBench 被 NeurIPS 2026 接收。论文主张,复杂任务的关键一步是先找出值得问的问题——把难题分解成能推动信念更新的「关键问题」,而现有基准只考答案对错。
基准设计:以「信息价值」(VOI)打分,衡量模型提出的关键问题对目标预测问题信念的更新幅度。三个罕见特性:
- 天然抗数据污染:ground truth 来自未来真实世界事件
- 开放式:接受任意文本作答,无唯一数值答案
- 有锚点:信息量以真实世界信念的量化变化为准
主要发现:在 293 个预测问题上评测 8 个模型,VOI 与独立能力指标高度相关(r=0.90),能反映关键问题的实际用处;但即便前沿 LLM,信息发现能力也只勉强超过随机时点基线——「会提问」仍是前沿模型的短板。
「研究」频道最新
- AI 解不开时间之谜:训练依赖时钟,无法跳出被解释对象 — johnseach · 2026-10-03
- arXiv 发文趋势推算:量子物理一年内获 AI 等同数学的加成 — cephaloform · 2026-10-03
- 伯克利人形智能中心夺 IROS 2026 RoCo 挑战赛双赛道第一 — berkeley_ai · 2026-10-03
- OpenStamp:把水印写进权重末层,开源模型也能防删水印 — danish037 · 2026-10-03
- Lampinen 炮轰神经符号派:符号主张屡屡退让难以自洽 — AndrewLampinen · 2026-10-03
- 新研究:用语言数据解析人类衰老中的认知变化 — abenitezburraco · 2026-10-03