UT Austin 提出交替思维链框架,小模型推理能力可迁移给大模型

UTEXAS · hf · 2026-09-30

UT Austin 团队发布 Allspark,一个弱到强迁移的训练与推理框架,旨在绕开大模型 rollout 的高昂成本:先训练一个小而弱的教师模型,与同一模型的冻结副本交替生成推理链片段,由冻结模型给出最终答案;推理时用更强的学生模型替换冻结模型,两者均保持固定。

由于师生通过纯文本通信,教师可以跨模型家族、跨 tokenizer 引导学生。实验在两个规模上验证:Qwen 上的数学与推理对照实验,以及更大规模的 Inkling 在 ARC-AGI-2 上的实验——包括向 Kimi 和 Nemotron 的跨家族迁移均取得准确率提升,收益随推理设置而异。

结论指向:训练好的弱教师可跨强学生复用,并需权衡准确率与 token 成本。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →