作者用 Dan Luu 方法自查 LLM 评审,五道练习揪出四个缺陷
alexpran · reddit · 2026-09-15
作者借鉴 Dan Luu 的「这个 benchmark 有什么问题?」读法,对自己维护的 LLM-as-judge 评测系统做了一次自查,发现评判器本身藏着四个缺陷。形式仿照 Dan Luu 的练习 7:先给现象再解释,每个数字都对应可查的 run 文件。
- 重复性噪声:同一 case 跑 16 次重复,不一致 case 数在 2/21 到 6/21 之间波动——单次运行的噪声底毫无意义
- 规模膨胀:测试集从 17 case 涨到 144,「任一 case 变差即失败」的阈值规则未调整,误报结构随之崩坏
- 监控盲区:precision 只算了两周、只覆盖半个流水线,数字一直「看起来合理」——问题在于缺乏从第一天就能暴露覆盖缺口的机制
- 改 prompt 的双输:两次经 review 的 judge prompt 修改,一次把 recall 从 0.80 打到 0.50,一次反而收窄了本想放宽的规则——共同点是都缺针对意图的回归评测
- 分歧的性质:4:1 与 3:2 的「错误」意义不同,分歧模式比分数本身更重要
作者在首条评论中给出答案与文件,欢迎挑错。
「编程与Agent」频道最新
- Codex 疑似悄悄下架 deep-research 技能,子代理运行时缩水 20% — Hot_Independence5160 · 2026-09-15
- DeepSeek Harness 仓库开源:dsh 编码 agent 框架已上 GitHub — alex_verem · 2026-09-15
- DeepSeek 开源 dsh:编码 agent 全插件化,无受保护内核 — alex_verem · 2026-09-15
- OSINT MCP Server 开源:一个工具包整合 Shodan、Censys 与 LinkedIn 情报 — modelcontextprotocol · 2026-09-15
- 零基础用户用 Claude 开发树莓派家庭中枢,指令文件膨胀到 1288 行 — BloodAngel09 · 2026-09-15
- Weaviate 指出把记忆当聊天记录堆会越堆越糟,介绍 Engram 方案 — philipvollet · 2026-09-15