基元律动开源 NeoHorse-1:把路由轨迹喂给小模型,验证 RSI 闭环
机器之心 · wechat · 2026-09-09
基元律动开源了 NeoHorse-1(4B/9B 两个尺寸,基座为 Qwen3.5),核心思路是让原本负责给模型「派活」的路由系统(OpenSquilla)顺便记录所有模型的执行轨迹,再把这些轨迹用于小模型的后训练,使其自己学会走完一群模型走过的路。团队将这一流程称为迈向 RSI(递归自我改进)的可复现单轮闭环验证,清华大学、北京大学及无问芯穹参与其中。
训练分四步:保留完整的「推理—行动—反馈」轨迹(主语料含十万到百万条脱敏轨迹);用确定性规则加六维语义评估过滤轨迹质量;借路由器预测的能力需求(C0-C3 分层)做课程学习;最后用路由引导的 On-Policy Distillation 蒸馏,并依据「能力短板地图」调整下一轮数据配比。评测上,4B 模型平均分从 58.94 升至 64.87(+5.93),9B 从 65.60 升至 69.04(+3.44),4B 已接近 Qwen3.5-9B 基座水平;提升集中在流程清晰、反馈可验证的任务,长程状态保持类任务仍吃力。
作者指出这尚不算完整 RSI:目前只验证了一轮「评估—选择—更新」,未证明跨代持续增益,但其意义在于把 RSI 变成一个可复现的工程问题——持续运转且留下结构化记录的 Harness,正成为下一代 Agent 模型最便宜也最难复制的训练数据来源。
「模型」频道最新
- 腾讯混元发布 Gander:全双工多模态交互智能体技术报告 — Tencent-Hunyuan · 2026-09-09
- Moonshot 开源 MoBA:称 95% 注意力计算被浪费,长文本快 16 倍 — gekobraa · 2026-09-09
- 从算错 2+2 到数学博士级:一张推文概括 AI 三年进化 — haider1 · 2026-09-09
- Muse Spark 1.3 横扫 tax agent 评测:每任务 $0.32,便宜 3 倍 — zainhas · 2026-09-09
- 阶跃 Step4 真的存在吗?一张「蒸馏」名单引发各家路线之辨 — zephyr_z9 · 2026-09-09
- 博主整理多家免费 API 通道:GLM、DeepSeek Flash 等模型可白嫖 — Roger_M_Taylor · 2026-09-09