MENTAT 方法提升推理密集型回归 65%,Khattab 团队新论文
lateinteraction · x · 2026-09-20
- Matt Latimer(lateinteraction)转发 Omar Khattab 与 Diane Tchuindjo 的论文《Reasoning-Intensive Regression》,并提出两个扩展方向:让模型在更难的决策前“想更久”,以及支持 dict/list 等复合类型而不仅布尔值。
- 论文定义了推理密集型回归(RiR):从文本推断细粒度数值分数,如 rubric 打分、密集奖励建模、领域检索,任务训练数据少但需要深度分析。
- 作者构建了 4 个 RiR 基准,验证了冻结 LLM 提示与微调 Transformer 编码器都会陷入困境的假设;提出 MENTAT,结合批量反思式提示优化与神经集成学习,相对基线最多提升 65%,但仍有较大改进空间。
- Latimer 补充猜想:RL for reasoning 接回归头,可能优于让模型口头报数的 verbalized regression。
所属事件:Meta 研究者新论:高效思考或逆转算力杰文斯悖论(3 条相关)→
「研究」频道最新
- EOS token 失配致 OPD 蒸馏长度膨胀:一个 Qwen3 rollout 答对后多生成 7098 冗余 token — tw_killian · 2026-09-20
- 28 年后 Metalog 回响:从 RDF 推理到 LLM 友好的自然语言推理 — narphorium · 2026-09-20
- 困扰数学界 147 年,Sylvester 猜想被完整证明 — IgorCarron · 2026-09-20
- XGEN 发布生成式世界模拟系统 JING+DAO,登顶 WBench 榜单 — hey_abusiddik · 2026-09-20
- Schmidhuber 重申:LLM 不算真正有创造力,缺了压缩进步机制 — SchmidhuberAI · 2026-09-20
- 实测 Jev 判 NASA 开普勒信号:总准确率仅 54%,输给三条规则基线 — This_Cell_1829 · 2026-09-20