研究发现推理 token 数可作为题目难度指标
一篇入选 EMNLP 2026 的 arXiv 论文《Thinking effort aligns between humans and reasoning models in abductive reasoning》对比了人类答题时间与模型在 160 道"最佳解释"常识题上的推理 token 数。结果显示,让人类变慢的题目通常也让模型"想"更久,且双方易错的题目高度重合,说明思考成本在溯因推理上与人类对齐。研究者提醒单次运行的 token 数波动较大,需多次运行取均值才能可靠衡量难度。
2026-09-06 ~ 2026-09-06 · 2 条相关
- EMNLP 2026 论文:推理模型与人类的思考成本在溯因推理上对齐 — rohanpaul_ai · 2026-09-06
- 推理 token 数可测题目难度,但需多次运行取均值 — rohanpaul_ai · 2026-09-06