UT Austin 提出交替思维链框架,小模型推理能力可迁移给大模型
UTEXAS · hf · 2026-09-30
UT Austin 团队发布 Allspark,一个弱到强迁移的训练与推理框架,旨在绕开大模型 rollout 的高昂成本:先训练一个小而弱的教师模型,与同一模型的冻结副本交替生成推理链片段,由冻结模型给出最终答案;推理时用更强的学生模型替换冻结模型,两者均保持固定。
由于师生通过纯文本通信,教师可以跨模型家族、跨 tokenizer 引导学生。实验在两个规模上验证:Qwen 上的数学与推理对照实验,以及更大规模的 Inkling 在 ARC-AGI-2 上的实验——包括向 Kimi 和 Nemotron 的跨家族迁移均取得准确率提升,收益随推理设置而异。
结论指向:训练好的弱教师可跨强学生复用,并需权衡准确率与 token 成本。
「研究」频道最新
- 从 Opus 5.5 系统卡反推 λ 值,验证 AI 任务并行化收益 — tobyordoxford · 2026-09-30
- davidad 上线交互页面,可视化测试贝叶斯认知模型 — davidad · 2026-09-30
- 微软研究院推出 Social-R1:用强化学习训练模型的社交推理 — burkov · 2026-09-30
- 建模 nixpkgs 全量形式化验证:95% 机器码或花 1.34 亿美元、2027 年底达成 — ctjlewis · 2026-09-30
- 《LLM 作为认知病毒》论文遭质疑:数学里没有 LLM 特异性 — hn1000 · 2026-09-30
- NeurIPS 2026 论文:AVIC 让模型学会该何时想象、想象多少 — mohitban47 · 2026-09-30