推理 token 数可测题目难度,但需多次运行取均值
rohanpaul_ai · x · 2026-09-06
- 研究者将人类答题时间与模型在 160 道"最佳解释"常识题上的推理 token 数对比,发现让人类变慢的题目通常也让模型"想"更久,且人类和模型容易错的题也高度重合。
- 单次运行的相关性不高;对 GPT-OSS-20B 尝试多条推理路径取均值后,人机相关性从 0.41 升至 0.55。
- 结论:思维链长度可作为题目难度的粗略信号,但要跨多次运行测量,模型"努力程度"才更有评测价值。
所属事件:研究发现推理 token 数可作为题目难度指标(2 条相关)→
「研究」频道最新
- NEAR AI Lean agent 全解 Putnam Bench,成本仅为次便宜方案的 1/250 — lukaszkaiser · 2026-09-06
- KV缓存原理详解:LLM推理中为何重要且常被误解 — techNmak · 2026-09-06
- AI 用 48 小时写 2 万行 Lean 代码,攻克 98 年未解的数学难题 — 量子位 · 2026-09-06
- 「认知地图作为思维媒介」新文分享 — abenitezburraco · 2026-09-06
- Google 论文数学证明:训练数据缺技能时,推理越长错误越爆炸 — solyarisoftware · 2026-09-06
- 北大与快手 Kling 推出 MAVIN,多镜头音视频生成入 ECCV 2026 Oral — jiqizhixin · 2026-09-06