researcher 提出 agent 能力金字塔:evals 优先于后训练

abeirami · x · 2026-09-10

abeirami 提出一个优先级排序:evals ≫ harness 优化(快速学习)≫ 模型后训练(慢速学习)。核心观点:- 大多数 agentic 任务根本不需要慢速学习循环(后训练)。- 即使最终目标是后训练,也应先做高信噪比(SNR)的 evals,再在信号上优化 harness 把性能提上去,最后把得到的系统行为「蒸馏」回权重。- 他特意为最后一步使用了 distill 这个词。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →