LLM 当裁判不靠谱:Jev 用结构化数据替代「词语腹泻」式评判
forevergeeks · reddit · 2026-09-30
作者指出长期存在的痛点:用 LLM 做 judge 效率不高——LLM 什么都能合理化,且倾向讨好,为了达到预期标准有时会编造结果。
作者试用 Jev 后认为其思路值得肯定:对结构化数据给出数学化结果,虽然仍是概率性的,但比一大段解释决策的文字更有用。文末疑问是 Jev 会不会出现开源替代品。
「编程与Agent」频道最新
- Miles v0.1.1 发布:Multi-LoRA 共享基座,原生支持 Claude Code 智能体训练 — ying11231 · 2026-09-30
- OpenAI 主动式个人助手 dots 早期实测:自动识别邮件并代开发票 — paw_lean · 2026-09-30
- Vercel Sandboxes 上手指南:隔离环境运行任意代码 — JohnPhamous · 2026-09-30
- 网友用 Claude Opus 5.5 重设计个人网站,还加进了诗集句 — soumitrashukla9 · 2026-09-30
- Latent Space 播客深谈 harness 工程:越聪明的模型越不需要人工验证 — trq212 · 2026-09-30
- 自审 AI 事故响应 agent:所谓 96% 置信度竟是三个 bug 造出来的 — Life_Rest_2488 · 2026-09-30