TokenRhythm 发布 NeoHorse-1:让 Agent 运行经验回流模型权重
Prajwal Tomar 发布长线程介绍 TokenRhythm,并开源了首个验证成果 NeoHorse-1 模型。其出发点是一个常见痛点:AI agent 能找到 bug、试错后解决,但第二天仍会犯同样错误——对话虽有记忆,底层模型本身没有变聪明,大量有价值的试错工作被浪费。TokenRhythm 试图把这些运行经验系统化为训练数据,回流到模型权重,形成「执行—记录—训练—再测试」的自我改进循环。早期结果显示方向有效:NeoHorse-1 4B 在十项测试中全胜其 Qwen3.5 基座,平均分从 58.94 提升至 64.87。
已确认
- TokenRhythm 由三部分组成:OpenSquilla 负责运行任务,TokenRhythm API 把任务连接到不同模型,NeoHorse-1 负责从经验中学习。
- 第一步是 Data-RSI:系统观察任务执行全过程——哪个模型完成了工作、用了哪些工具、在哪里失败、如何恢复、最终答案是否有效——有用的运行记录随后成为训练下一代模型的样本。
- 第二步是测试驱动的数据闭环:对模型测试找出弱项(如编码、工具使用或指令遵循上的挣扎),下一批训练数据就增加这类任务占比,更新后的模型再返回接受新一轮测试,如此往复。
- NeoHorse-1 已开源,提供 4B 和 9B 两个检查点,均从 Qwen3.5 后训练而来,具备原生 262K 上下文窗口,官方自称是通往递归自我改进(RSI)的早期原型,技术报告已上传 arXiv。
- Tomar 引述官方早期测试数据:十项测试中 NeoHorse-1 4B 每一项都优于 Qwen3.5 基座,平均分从 58.94 升至 64.87。
尚未确认
- 上述十项测试结果来自 TokenRhythm 官方早期数据,Tomar 本人也做了相应说明,尚缺独立第三方验证。
为什么重要
- 当前 agent 的运行经验大多停留在对话层面,未能回流到模型权重。TokenRhythm 提供了将 agent 实际执行轨迹系统化为训练数据的路径,而 NeoHorse-1 的开源与其相对基座的全面提升,为「从 agent 运行中学习」这一理念提供了首个可复现的公开验证载体。
2026-09-16 ~ 2026-09-16 · 9 条相关
一手来源
- NeoHorse-1 开源:基于 Qwen3.5 的递归自我改进模型原型 — PrajwalTomar_ ·
- NeoHorse-1 4B 十项测试全胜基线:平均分从 58.94 升至 64.87 — PrajwalTomar_ ·
- NeoHorse-1 发布:基于 Qwen3.5 的 4B/9B 开源模型,原生 262K 上下文 — PrajwalTomar_ ·
- AI Agent 修完 bug 就忘:TokenRhythm 想让运行经验沉淀回模型 — PrajwalTomar_ · 2026-09-16
- 让模型从 Agent 运行中学到教训:TokenRhythm 的三层设计 — PrajwalTomar_ · 2026-09-16
- TokenRhythm 三件套:OpenSquilla 执行、API 接模型、NeoHorse-1 吸收经验 — PrajwalTomar_ · 2026-09-16
- TokenRhythm 提出 Data-RSI:把 agent 的成功运行变成训练数据 — PrajwalTomar_ · 2026-09-16
- TokenRhythm 训练闭环:测出弱项就在下批数据里加码同类任务 — PrajwalTomar_ · 2026-09-16
- 【源头】NeoHorse-1 发布:基于 Qwen3.5 的 4B/9B 开源模型,原生 262K 上下文 — PrajwalTomar_ · 2026-09-16
- 【源头】NeoHorse-1 4B 十项测试全胜基线:平均分从 58.94 升至 64.87 — PrajwalTomar_ · 2026-09-16
- 【源头】NeoHorse-1 开源:基于 Qwen3.5 的递归自我改进模型原型 — PrajwalTomar_ · 2026-09-16
另有 1 条近重复转述:PrajwalTomar_