NeoHorse-1:用路由型 Agent 后训练逼近递归自我改进
TokenRhythm · hf · 2026-09-09
Hugging Face 上发布的工作 NeoHorse-1 提出通过 agentic post-training 实现递归自我改进:结合智能路由、结构化反馈回路和基于课程的蒸馏,在多个 agent benchmark 上提升模型能力。属于把后训练与 agent 能力提升结合的方法探索。
所属事件:NeoHorse-1 论文提出递归自我改进的 Agentic 后训练路线(2 条相关)→
「研究」频道最新
- UCLA发布VDiff-Bench:多模态模型细粒度图像差异识别集体翻车 — UCLA · 2026-09-10
- 新基准 VDiff-Bench:1756 题暴露前沿模型找不同能力短板 — yixin_wan_ · 2026-09-10
- Michael Levin 新论文:以结构化潜空间刻画新形态的生命与心智 — danfaggella · 2026-09-10
- 研究显示「末日论者预测更准」或只是流言:XPT 锦标赛复盘 — random_walker · 2026-09-10
- AI 安全前沿正从神经网络转向智能体网络的可解释性 — Hidenori8Tanaka · 2026-09-10
- AI 影像+基因组学发现心脏-脾脏轴关联 — EricTopol · 2026-09-10