华为诺亚前主任王云鹤创业首秀:NeoHorse 把多模型执行经验练进 4B 模型
量子位 · wechat · 2026-09-08
华为诺亚方舟实验室前主任、盘古大模型负责人王云鹤创办的基元律动发布首个 Agent-Native 模型 NeoHorse,由无问芯穹提供算力与 Infra 优化,清华、北大团队参与算法研究。NeoHorse-1 含 4B 和 9B 两个版本,聚焦调用工具、读取环境反馈、发现错误、调整路径等 Agent 能力;经 Agentic Post-Training 后,4B 综合表现(宏平均 58.94→64.87)在 10 项评测中超越基础模型 Qwen3.5-4B,达到同规模 SOTA。
核心思路:把 Harness 执行日志练进模型
- 训练语料来自其 RoutingHarness 产生的 Agent 执行信号:路由器判断、模型切换、失败与修复轨迹、环境验证结果。失败轨迹尤其有价值,补充了「哪里容易出错、出错后如何调整」两类知识。
- 每条轨迹经结构检查后从六维评估质量(是否完成目标、工具使用、证据支撑、错误恢复等);再用 Routing-Guided Curriculum 按能力档位排序课程,先易后难;另用 On-Policy Distillation 让教师针对学生实际步骤给指导。
商业布局与 RSI 叙事
基元律动已形成四层产品线:开源 OpenSquilla、TokenRhythm API(类中国版 OpenRouter)、企业服务、以及 NeoHorse 模型,验证了「执行经验→训练数据→模型能力」的商业飞轮。公司称这是向 RSI(递归自我改进)方向的一次单轮工程验证(Data-RSI + Model-RSI),但信号与奖励设计仍由人类设定,多代迭代能否持续增益待验证。风险在于 DeepSeek、Qwen 等厂商正向 Harness/Agent 垂直整合,模型中间层生存空间可能被压缩。
「公司和人」频道最新
- OpenAI首席科学家:放弃数学聚焦,优先押注RSI与自动对齐 — Dr_Singularity · 2026-09-08
- 吉卜力董事长:宫崎骏根本不知道生成式 AI 是什么 — PAstynome · 2026-09-08
- 每 8 个月就冒出新 AI 领导者,谈何持久结构性优势? — josh_wills · 2026-09-08
- 2026年8月生成式AI网站流量份额最新数据出炉 — FinanceYF5 · 2026-09-08
- OpenAI 前工程师反驳 Codex 起源说:本为加速基建的内部工具 — gabrielchua · 2026-09-08
- GrokBot 拿到微软账号钥匙:常驻云电脑 7×24 代理邮件日历网盘 — 新智元 · 2026-09-08