评测能否用同一个模型?Hamel:先验证 judge 与人类标签对齐
HamelHusain · x · 2026-10-08
- Hamel Husain 与 Shreya Shankar 在 AI Evals FAQ 中回答:主任务和评测用同一个模型通常可以,因为 judge 做的是与主 pipeline 不同的任务。
- 关键不是「自评偏见」,而是 judge 与人类判断的对齐程度:在留出的标注测试集上追求高 TPR/TNR,做限定范围的二分类任务,通常可通过与人类标签迭代对齐实现。
- 若对齐不达标再换模型;选 judge 时先用最强模型建立可靠评测标准,之后再优化成本。
「编程与Agent」频道最新
- LlamaIndex:文档解析默认输出 Markdown,合并表头才用 HTML — llama_index · 2026-10-09
- 等 Claude 额度重置太无聊,开发者的新消遣是手写 Go — haydendevs · 2026-10-09
- Orchestrator 重写内置终端:输入延迟降至 13ms,输出快 5 倍 — julianweisser · 2026-10-09
- 开发者免费放出《AI 软件工厂》电子书,讲 Agentic SDLC — Pavan_Belagatti · 2026-10-09
- Infisical 推出 Agent Vault:让 AI Agent 用 API 不碰真实凭证 — ycombinator · 2026-10-09
- 福布斯发布首份 Agentic 20 榜单:20 家做真活的 AI Agent 公司 — annatonger · 2026-10-09