Delip Rao 批评 LLM Judge 社区两年只写单体 prompt,autorubric 才破局
deliprao · x · 2026-09-21
Delip Rao 在与 Shriram Murthi 的讨论中指出:LLM-as-Judge 社区存在两年,一直用单体 prompt 写评判标准,直到 autorubric 出现才开始系统化方法;这与社会科学方法论文献早有共识形成反差。Murthi 补充认为 Jev 的卖点在于并行度与速度(架构差异带来的「System 1」式能力)。讨论核心是评估方法论,而非具体模型。
所属事件:Delip Rao 批 LLM Judge 社区两年只写单体 prompt(2 条相关)→
「编程与Agent」频道最新
- GitHub Actions MCP 服务器:让 AI 直接查日志、重跑失败任务 — modelcontextprotocol · 2026-09-21
- Block 开源 Buzz:33.8k star 的人机共享协作平台 — abhishek__AI · 2026-09-21
- 被 AI 颠覆恐惧蔓延,独立开发者建「无聊应用」对冲风险 — alexmacgregor__ · 2026-09-21
- 开源协作平台 Buzz 让 AI Agent 与人类同频道共建工作区 — abhishek__AI · 2026-09-21
- OpenClaw 过 Trail of Bits 审计:23 个确认漏洞,零 Critical — steipete · 2026-09-21
- 开发者实测 KLPO 训练后端:默认梯度等价 REINFORCE,异步训练被拒 — burny_tech · 2026-09-21