Hamel Husain:Jev 可用于 Evals,LLM Judge 本质是分类器
HamelHusain · x · 2026-09-20
AI Evals 领域知名作者 Hamel Husain 回应「能不能用 Jev 做评测」:可以。核心观点是 LLM Judge 本身就是一个分类器,因此关键不在用哪个模型,而在方法——务必用人工标注来验证你的分类器,避免过拟合。他附上自己博客的 FAQ:为什么推荐二值(pass/fail)评测而非 1-5 打分?理由包括:相邻分值的差异主观且标注者间不一致;打分制检测统计差异需要更大样本量;标注者倾向选中间值回避艰难判断。想追踪渐进改进,可以把子指标拆成独立的二值检查(如「5 个预期事实包含 4 个」),而不是用连续量表。
所属事件:LangChain 推出 Jev-as-a-Judge 并上线 LangSmith(9 条相关)→
「编程与Agent」频道最新
- Agent 过了评测还不够:Anthropic「瑞士奶酪模型」谈多层质检盲区 — hugobowne · 2026-09-22
- OpenAI 艺术家团队全员用上 Codex,两周内普及率 100% — andrew_n_carr · 2026-09-22
- PyTorch 官方推 TinyTorch:20 模块纯 Python 从零造 ML 框架 — PyTorch · 2026-09-22
- Codex 自适应推理:根据任务难度在思维链中途动态调整推理力度 — daniel_mac8 · 2026-09-22
- 用 Codex 搭端到端视频剪辑发布流水线,AI 解放创作瓶颈 — brandon_galang · 2026-09-22
- 用 Codex 操控 Blender 截图对齐装配零件的实操技巧 — majidmanzarpour · 2026-09-22