作者用 Dan Luu 方法自查 LLM 评审,五道练习揪出四个缺陷

alexpran · reddit · 2026-09-15

作者借鉴 Dan Luu 的「这个 benchmark 有什么问题?」读法,对自己维护的 LLM-as-judge 评测系统做了一次自查,发现评判器本身藏着四个缺陷。形式仿照 Dan Luu 的练习 7:先给现象再解释,每个数字都对应可查的 run 文件。

作者在首条评论中给出答案与文件,欢迎挑错。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →