EMNLP 2026 论文:推理模型与人类的思考成本在溯因推理上对齐
rohanpaul_ai · x · 2026-09-06
arXiv 论文《Thinking effort aligns between humans and reasoning models in abductive reasoning》(将发表于 EMNLP 2026 Findings)比较了人类反应时间与推理模型 reasoning token 数在 160 道常识「最佳解释」题上的表现。核心发现:
- 大推理模型(LRM)与人类在同样的题目上费劲:同一批难题既拖慢人类,也让模型消耗更多 reasoning token,提示「思考成本」在人与模型间存在行为对齐。
- 模型与人类倾向于犯相似的错误。
- 溯因推理(abductive reasoning)的难度无法从形式结构推断,没有可被模型钻空子的捷径,为「共享努力」提供了更坚实的实证依据。
- 允许模型探索多条推理路径的解码方法会进一步提升人-模型推理成本的对齐度(在三个模型上验证)。
作者提醒:单次模型运行的 token 数不可作为题目难度的可靠指标,需多次运行。
所属事件:研究发现推理 token 数可作为题目难度指标(2 条相关)→
「研究」频道最新
- 15个前沿LLM医疗测试:对抗压力下94%正确答案失效 — davidmanheim · 2026-09-06
- 哈佛论文惊悚命名:大语言模型是「认知病毒」 — mikeflache · 2026-09-06
- 实测推翻论文数据:DiffusionGemma 峰值吞吐实为 3k tok/s,约为论文 3 倍 — bodonoghue85 · 2026-09-06
- Google Astra 复查论文复现代码,揪出顶级期刊重大错误 — soumitrashukla9 · 2026-09-06
- 作者为 HF LLM 推理实现滑窗注意力,实测 32K 上下文 KV 缓存 3.5MB — ahsaor8 · 2026-09-06
- IndianRailwayBench:用抢印度火车票实测各 LLM 真实能力 — Paimaamu · 2026-09-06