判断器刷爆榜单背后:个人 AI 的选项表归属被忽视
sujingshen · x · 2026-09-21
针对「专门做 Choice/Score/Yes-No 的判断器(judge)问世后,大量榜单正以前所未有的速度被刷爆」的讨论,作者承认这类模型有用——像餐厅里专管「甜的还是咸的、几分熟」的助手,让主厨不必为小选择烧大火,把控制流变便宜是好事。
但他更担心另一面:选项表还属不属于你。他判断较慢、贵、占上下文的问题,比不上更深的问题——合法选项由谁书写、按谁的标准分流。模型一换,表就蒸发;分数再好看,你的红线却无处安放。
他提出评估判断器的四条标准:
- 选项列表谁定义,能否导出带走
- 路由标准是任务吞吐,还是写进了你的红线
- 换模型之后,这张表还是不是你的
- 分错时能否留下否决史,而不只是更高的分
结论:「更快的小脑,不等于更懂你的人。Personal AI 要的是控制流可以外包,选项表的归属不能外包。」
「模型」频道最新
- $200 套餐 48 小时烧掉 33%,用户吐槽 OpenAI 额度大缩水 — AIandDesign · 2026-09-21
- DeepSeek 网页版文风被指遭安全对齐「脑叶切除」 — Old_Let6328 · 2026-09-21
- JEV 取消 waitlist 开放:5 美元额度、输入仅 0.042 美元且输出免费 — op7418 · 2026-09-21
- Stefano Ermon 做客 No Priors:扩散 LLM 并行生成是对 scaling 时代的回应 — saranormous · 2026-09-21
- 实测决策模型 Jev:两条 prompt 工程经验与本地 27B 对比 — colinmcnamara · 2026-09-21
- 决策模型 Jev 校准误差约 0.09:对得准但「自信度」仍失真 — colinmcnamara · 2026-09-21