作者澄清:不是反对 LLM-as-judge,是正则抓不住语义细微差别
xeophon · x · 2026-09-16
xeophon 澄清自己此前关于 eval 的帖子被误读为「反对 LLM 作为评判者」:他强调用正则表达式捕捉语义细微差别是不可行的——例如 "- <数字>" 有时应判为负数,有时只是列表符号,这类判断只能靠 LLM judge 完成。
「编程与Agent」频道最新
- 离职即失访问权:开发者痛失 5 年 commit 历史,无法用于训练个人 agent — DanielLockyer · 2026-09-16
- Neo4j 将办 GraphRAG 工作坊:知识图谱 + 智能体检索实战 — camerongreen95 · 2026-09-16
- 开发者首次让 LLM 全面找 bug,竟挖出可变砖设备的全链路攻击 — matthew_d_green · 2026-09-16
- 曝 Claude Code 将迎 Sessions Hub:本地云端会话统一管理 — testingcatalog · 2026-09-16
- 开源多人 AI 助手 Rowboat:团队白板协作,@rowboat 直接实现 — ycombinator · 2026-09-16
- 开发者开源工具扫描会话日志,揪出 agent 反复踩的同一个坑 — EvenAd1183 · 2026-09-16