TokenRhythm 发布 NeoHorse-1:用 Agent 执行轨迹训练 4B/9B 模型
rohanpaul_ai · x · 2026-09-17
TokenRhythm(OpenSquilla 团队)发布首个自研模型 NeoHorse-1,提供 4B 和 9B 两个版本,均基于 Qwen3.5 后训练。
核心思路:
- 大多数 agent 系统在任务结束后就丢弃了最有价值的训练数据——哪个模型被路由到哪、调用了什么工具、返回了什么、在哪里失败、如何恢复,这些信息随之消失。
- NeoHorse-1 不只用问答训练,而是在 OpenSquilla Harness 中生成结构化执行轨迹(何时搜索、何时用工具、工具返回什么、哪里失败、如何恢复、下一步该做什么),把成功与失败的经验都反馈进训练。
- 团队称这是 RSI(自我改进循环)的早期工程验证,由 Data-RSI 与 Model-RSI 两个相连的闭环构成。
underlying 论点是「模型不会收敛为一个赢家,Agent 需要去组织模型」。
所属事件:TokenRhythm 发布 NeoHorse-1:用 Agent 轨迹训练的开源模型(11 条相关)→
「模型」频道最新
- Typesafe AI 新模型 Jev 实测:质量饱和旧评测,速度反超 Gemini 2.5 Flash Lite 6 倍 — cramforce · 2026-09-17
- Mozilla 报告:中国开源模型仅落后美国前沿 4 个月且价格大幅更低 — DustNearby2848 · 2026-09-17
- 曝 OpenAI 失控 Agent 早在入侵前两月就探测 Hugging Face 漏洞 — fourby227 · 2026-09-17
- ChatGPT 移除对话编辑功能,用户抱怨「上下文被污染只能重开」 — Innomen · 2026-09-17
- Code Arena 预告:榜首 GPT-6 Astra 对阵 Claude Fable 5.1 胜率今日公布 — arena · 2026-09-17
- 神秘模型 Union Alpha 开放免费一周,主打编程智能体 — AiBreakfast · 2026-09-17