Kitaru 开源校准 Skill:验证 LLM 评委与人类判断是否一致

strickvl · x · 2026-09-24

strickvl 提醒:jev 评委给出的分数是概率而非实测准确率,直接用其做门禁前必须先用自己的标注做校准。为此 Kitaru 发布了一个 validate-evaluator skill,引导人类逐一检查评委与自己的判断标准是否对齐,包括检查分歧案例、在开发集上改进、在留出集上冻结配置评估。

作者还用逐字段修改会话的方式验证了 jev 不是在机械匹配数字:来自政策工具的「30 天」能通过,而向客户承诺「30 天」退款则失败——即使工具结果里也有 30(那是退货窗口而非退款时限)。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →