researcher 提出 agent 能力金字塔:evals 优先于后训练
abeirami · x · 2026-09-10
abeirami 提出一个优先级排序:evals ≫ harness 优化(快速学习)≫ 模型后训练(慢速学习)。核心观点:- 大多数 agentic 任务根本不需要慢速学习循环(后训练)。- 即使最终目标是后训练,也应先做高信噪比(SNR)的 evals,再在信号上优化 harness 把性能提上去,最后把得到的系统行为「蒸馏」回权重。- 他特意为最后一步使用了 distill 这个词。
「编程与Agent」频道最新
- Alchemy Run CLI 大改版将发布:新增 dev/deploy/destroy 视图 — samgoodwin89 · 2026-09-10
- Cohere Labs 分享:构建亚洲语言语音 Agent 的实测要点与数据 — Cohere_Labs · 2026-09-10
- 评测分数 0.94 却照样失败:Conviva 谈 agent 评测的盲区与补救 — Automatic-Mirror7324 · 2026-09-10
- ComfyUI 0.35.0 上线 MiniMax H3 并行蒸馏 LoRA 与 Fun ControlNet 教程 — optimisticalish · 2026-09-10
- Unity 官方发布 Claude Code 插件:一条命令解锁 29 项 Unity 技能 — jh3yy · 2026-09-10
- 机器人创企发布 GRID Auto-Engineering,全自动构建与部署机器人智能 — akapoor_av8r · 2026-09-10