作者澄清:不是反对 LLM-as-judge,是正则抓不住语义细微差别

xeophon · x · 2026-09-16

xeophon 澄清自己此前关于 eval 的帖子被误读为「反对 LLM 作为评判者」:他强调用正则表达式捕捉语义细微差别是不可行的——例如 "- <数字>" 有时应判为负数,有时只是列表符号,这类判断只能靠 LLM judge 完成。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →