LLM judge 也该学金融监管:模型一换就重测判官准确率
sh_reya · x · 2026-09-25
shreya 引用 Hamel Husain 与她合著的《Evals for AI Engineers》第 5 章:评估 LLM judge 的第一步是测量 judge 本身的准确率,用不完美的 judge 估计真实成功率。她指出 MiFID II RTS 6 第 13(6) 条早有先例——从事算法交易的投资公司必须至少每年审查一次自动监控系统评估其误报/漏报能力。类比结论:LLM judge 在其底层模型每次变更时都应重新校验准确率。
「编程与Agent」频道最新
- AI agent 常把简单任务做偏,团队引入 Jev 监控防工具蔓延 — alexcovo_eth · 2026-09-25
- 开源 Connectome:把 AI 记忆像人一样分层折叠而非一删了之 — repligate · 2026-09-25
- Opus 5.5 一天造出 2 公里岛屿生存游戏,4.4 万棵树全部代码生成 — majidmanzarpour · 2026-09-25
- 三个状态撑起 ComfyUI:SUCCESS、FAILURE、PENDING 的架构解析 — Mahmoud_Zalt · 2026-09-25
- Agentic 软件工厂长文:编码提速不等于交付提速 — Pavan_Belagatti · 2026-09-25
- 开发者开源浏览器端工具:一键生成 OpenAI 严格 JSON Schema — Top-Coder-5852 · 2026-09-25