LLM 当裁判不靠谱:Jev 用结构化数据替代「词语腹泻」式评判

forevergeeks · reddit · 2026-09-30

作者指出长期存在的痛点:用 LLM 做 judge 效率不高——LLM 什么都能合理化,且倾向讨好,为了达到预期标准有时会编造结果。

作者试用 Jev 后认为其思路值得肯定:对结构化数据给出数学化结果,虽然仍是概率性的,但比一大段解释决策的文字更有用。文末疑问是 Jev 会不会出现开源替代品。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →