Delip Rao 批评 LLM Judge 社区两年只写单体 prompt,autorubric 才破局

deliprao · x · 2026-09-21

Delip Rao 在与 Shriram Murthi 的讨论中指出:LLM-as-Judge 社区存在两年,一直用单体 prompt 写评判标准,直到 autorubric 出现才开始系统化方法;这与社会科学方法论文献早有共识形成反差。Murthi 补充认为 Jev 的卖点在于并行度与速度(架构差异带来的「System 1」式能力)。讨论核心是评估方法论,而非具体模型。

所属事件:Delip Rao 批 LLM Judge 社区两年只写单体 prompt(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →