NeoHorse-1 论文提出递归自我改进的 Agentic 后训练路线

TokenRhythm 团队在 Hugging Face 发布 NeoHorse-1 论文,提出通过带路由机制的 Agentic 后训练实现递归自我改进。方法结合智能路由、结构化反馈回路与基于课程的蒸馏,尝试让模型在多轮任务中持续优化自身表现,被视为通往自提升 AI 系统的一种新探索。

2026-09-09 ~ 2026-09-10 · 2 条相关