Delip Rao 吐槽:LLM Judge 社区两年只写单体 prompt,autorubric 才破局
deliprao · x · 2026-09-21
Delip Rao 在讨论中指出,LLM Judge 社区存在两年来一直没有做结构化判据设计,大家持续写单体(monolithic)prompt,直到 autorubric 出现才改变这一局面;他同时认同 Jev 的速度与并行度是其独特卖点。这条评论也是 IanArawjo 指出 autorubric 与 typesafeai 的 Jev 在判据抽象上(Noul/Score/Choice 与其 criterion 类型一一对应)高度相似的讨论背景。
所属事件:Delip Rao 批 LLM Judge 社区两年只写单体 prompt(2 条相关)→
「编程与Agent」频道最新
- 「AI 正在取代 if 语句」:Tomasz Tunguz 谈 AI 重塑传统编程逻辑 — hardimanjames · 2026-09-22
- Thorsten Ball 断言:代码评审将死,单元测试也难逃一劫 — rseroter · 2026-09-22
- Tinfield 1 开源发布:177B 参数终端编码模型自称超越 Claude Opus 4.8 — victormustar · 2026-09-22
- Qwen Code Desktop v0.24.3 发布:新增钉钉输出、bwrap 沙箱等更新 — github-actions[bot] · 2026-09-22
- Chris Ré 组:智能体接管抽象层,CUDA DSL 该退休了 — ricklamers · 2026-09-22
- 马斯克晒多智能体工作流:Grok Bot 统筹 Claude Code 与 Codex — elonmusk · 2026-09-22