基元律动开源 NeoHorse-1:把路由轨迹喂给小模型,验证 RSI 闭环

机器之心 · wechat · 2026-09-09

基元律动开源了 NeoHorse-1(4B/9B 两个尺寸,基座为 Qwen3.5),核心思路是让原本负责给模型「派活」的路由系统(OpenSquilla)顺便记录所有模型的执行轨迹,再把这些轨迹用于小模型的后训练,使其自己学会走完一群模型走过的路。团队将这一流程称为迈向 RSI(递归自我改进)的可复现单轮闭环验证,清华大学、北京大学及无问芯穹参与其中。

训练分四步:保留完整的「推理—行动—反馈」轨迹(主语料含十万到百万条脱敏轨迹);用确定性规则加六维语义评估过滤轨迹质量;借路由器预测的能力需求(C0-C3 分层)做课程学习;最后用路由引导的 On-Policy Distillation 蒸馏,并依据「能力短板地图」调整下一轮数据配比。评测上,4B 模型平均分从 58.94 升至 64.87(+5.93),9B 从 65.60 升至 69.04(+3.44),4B 已接近 Qwen3.5-9B 基座水平;提升集中在流程清晰、反馈可验证的任务,长程状态保持类任务仍吃力。

作者指出这尚不算完整 RSI:目前只验证了一轮「评估—选择—更新」,未证明跨代持续增益,但其意义在于把 RSI 变成一个可复现的工程问题——持续运转且留下结构化记录的 Harness,正成为下一代 Agent 模型最便宜也最难复制的训练数据来源。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →