LLM 评测先要人工标注,再用模型做仪器化判断
sh_reya · x · 2026-07-27
- 这条把 evals 拆成两件完全不同的事:发现失败模式,以及测量这些失败模式到底有多常见。
- LLM 可以帮忙发现一部分失败模式,但不可能覆盖全部,因为很多失败本身带有主观性,取决于人类如何解释输出。
- 在第二步里,LLM 也能读 trace、判断某种失败是否存在,从而辅助统计覆盖率,但前提是仍有人工标注作基准。
- 作者强调:不要试图让 LLM 同时完全自动化发现和测量;LLM judge 应该是对人类专家的补充,而不是替代。
「研究」频道最新
- 上周机器人论文盘点:BFM-Zero 训练提速 1.3 倍 — carlosdponx · 2026-07-27
- Laguna 测试 2.75 和 3.25 bpw 量化方案 — QuixiAI · 2026-07-27
- Nature Communications 推出 PeptiVerse,统一预测肽可开发性 — Ghost_Pilot_MD · 2026-07-27
- Google 的 CodeMender 已能独立使用,但最强版仍需邀请 — shashib · 2026-07-27
- TB2-Fn 发现 agent 可刷过 7 个终端任务并误差达 40% — abeirami · 2026-07-27
- 改 chunk 长度会改基准,不只是改一个 perplexity 数字 — gordic_aleksa · 2026-07-27