Guidance-TTT:测试时只训 8B 小模型,科学发现任务刷新 4 项最佳
pliang279 · x · 2026-10-07
MIT 等团队提出 Guidance-TTT:把「提出思路」与「落地执行」分离——测试时用一个 8B 小模型基于验证器反馈做在线训练,提出高层策略改动;冻结的大模型只负责把策略转成可执行代码,执行验证后用自适应组相对 RL 目标更新小模型。
要点:
- 避免了对大模型做测试时训练的高昂成本(梯度/优化器状态+长结构化输出生成),并把 credit assignment 收敛到短策略空间
- 仅用开源权重模型、无联网检索,在 4 个科学发现任务上超过已报道的最佳结果
- 论文与代码均已开源(arXiv:2610.06269)
「研究」频道最新
- Scott Alexander 公开信回应 Pinker:通用智能因子真实存在,AI 能力将持续攀升 — Astral Codex Ten · 2026-10-07
- 论文:扩散 Transformer 生成早期即可读出大量图像信息 — kwangmoo_yi · 2026-10-07
- 合成细胞为何五代即衰:答案是它无法分解自身「垃圾」 — NikoMcCarty · 2026-10-07
- LLM 数值线性代数综述:从 QR 算法到支撑大模型的矩阵方法 — Abdelkader Baggag · 2026-10-07
- 哈佛发布智能体血液生物标志物发现工具:隐私不出域,AUC 中位提升 4.18 点 — Harvard · 2026-10-07
- 斯坦福研究:多用户各派一个 agent,团队效果反而不如单个 agent — rohanpaul_ai · 2026-10-07