AI 评测专家:自上而下出题靠 Claude,自下而上提炼标准全靠人
HamelHusain · x · 2026-08-24
petergyang 与 AI 评测专家 Shreya Rajpal、Hamel Husain 对谈,梳理了两类评测(evals)的分工:自上而下(top-down)是在只有任务描述、从零出发的情况下设计评测,Claude 在这类场景帮得上很大忙;自下而上(bottom-up)则是反复查看大量真实样本输出,把自己的直觉反馈外化为评测标准——Shreya 强调 Claude 在这类评测上「非常非常差」,这部分完全要靠人自己。
两位曾向 4,500+ 工程师和 PM 教过 AI 评测,节目中他们现场审计了 petergyang 为创作者技能构建的评测,并演示了一个可在 Claude Code 或 Codex 中使用的免费 skill,用于把反馈变成可复用的评测。核心观点:评测的基本功没变——从看真实数据开始,变化在于让 agent 帮你更有条理地分析数据;agent 的工作不是发明新反馈,而是外化你的判断。
所属事件:AI 评测专家谈如何用 Claude Code 构建评估(3 条相关)→
「编程与Agent」频道最新
- 研究揭示 AI Agent 行为:六成阅读量来自指令与笔记 — dair_ai · 2026-08-24
- Claude 自主验证 43 个数学模块,AI 攻克理论物理难题 — Tkaraletsos · 2026-08-24
- Compound Engineering 插件重写:上下文体积缩减 70% — iamrobotbear · 2026-08-24
- Lighter 证明器挑战突破 10 万 TPS,两周提升超十倍 — econoar · 2026-08-24
- AI 假记忆:为何模型越用越错,真记忆需遗忘 — PrajwalTomar_ · 2026-08-24
- 观察发现 Codex 积分耗尽后仍继续运行任务 — gandamu_ml · 2026-08-24