SCATR 论文:用轻量校准评分器低成本选出 LLM 最佳候选答案
pliang279 · x · 2026-09-30
斯坦福 Percy Liang 转发的论文 SCATR(Simple Calibrated Test-Time Ranking)被 COLM 2026 Efficient Reasoning Workshop 接收。
- 核心问题:随着 test-time compute 与 agentic 系统生成越来越多候选解,生成本身只是一半,「哪个答案值得信、如何低成本做出这个判断」正成为 test-time scaling 的真瓶颈。
- 方法:给定一个 LLM 和一个小型校准集,在模型自身表征上训练一个轻量评分器来对候选答案排序,无需重型 verifier 或再起一个昂贵的自回归模型。
- 结论:实证显示这个极简 verifier 在代码与数学任务上已能大幅改善 best-of-n 选择效果。
作者认为这是 Jev 类「专用快速校准决策模型」方向的一个简单可复用配方。
「研究」频道最新
- 政府气象模型 WRF 移植 GPU,速度快一个量级出 250 米分辨率 — Scobleizer · 2026-09-30
- François Fleuret:AI 数学将让人类数学彻底边缘化 — francoisfleuret · 2026-09-30
- GPU 空转高达 74%,微软研究院 SortedRL 直击 RL 训练调度瓶颈 — burkov · 2026-09-30
- UMass 教授 Luc Rey-Bellet 三套随机过程讲义公开,覆盖 MCMC 基础 — michaelchchoi · 2026-09-30
- VoxMem 基准:15 个音频大模型记忆能力无一超过 40% — unimelb-hf · 2026-09-30
- EpiCon:多智能体共享多模态记忆库,11 项基准平均提升 1.7-4.9 分 — Ziyun Zeng · 2026-09-30