NeoHorse-1:用路由型 Agent 后训练逼近递归自我改进

TokenRhythm · hf · 2026-09-09

Hugging Face 上发布的工作 NeoHorse-1 提出通过 agentic post-training 实现递归自我改进:结合智能路由、结构化反馈回路和基于课程的蒸馏,在多个 agent benchmark 上提升模型能力。属于把后训练与 agent 能力提升结合的方法探索。

所属事件:NeoHorse-1 论文提出递归自我改进的 Agentic 后训练路线(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →