AI 评测专家:自上而下出题靠 Claude,自下而上提炼标准全靠人

HamelHusain · x · 2026-08-24

petergyang 与 AI 评测专家 Shreya Rajpal、Hamel Husain 对谈,梳理了两类评测(evals)的分工:自上而下(top-down)是在只有任务描述、从零出发的情况下设计评测,Claude 在这类场景帮得上很大忙;自下而上(bottom-up)则是反复查看大量真实样本输出,把自己的直觉反馈外化为评测标准——Shreya 强调 Claude 在这类评测上「非常非常差」,这部分完全要靠人自己。

两位曾向 4,500+ 工程师和 PM 教过 AI 评测,节目中他们现场审计了 petergyang 为创作者技能构建的评测,并演示了一个可在 Claude Code 或 Codex 中使用的免费 skill,用于把反馈变成可复用的评测。核心观点:评测的基本功没变——从看真实数据开始,变化在于让 agent 帮你更有条理地分析数据;agent 的工作不是发明新反馈,而是外化你的判断。

所属事件:AI 评测专家谈如何用 Claude Code 构建评估(3 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →