Guidance-TTT:测试时只训 8B 小模型,科学发现任务刷新 4 项最佳

pliang279 · x · 2026-10-07

MIT 等团队提出 Guidance-TTT:把「提出思路」与「落地执行」分离——测试时用一个 8B 小模型基于验证器反馈做在线训练,提出高层策略改动;冻结的大模型只负责把策略转成可执行代码,执行验证后用自适应组相对 RL 目标更新小模型。

要点:

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →