Kitaru 开源校准 Skill:验证 LLM 评委与人类判断是否一致
strickvl · x · 2026-09-24
strickvl 提醒:jev 评委给出的分数是概率而非实测准确率,直接用其做门禁前必须先用自己的标注做校准。为此 Kitaru 发布了一个 validate-evaluator skill,引导人类逐一检查评委与自己的判断标准是否对齐,包括检查分歧案例、在开发集上改进、在留出集上冻结配置评估。
作者还用逐字段修改会话的方式验证了 jev 不是在机械匹配数字:来自政策工具的「30 天」能通过,而向客户承诺「30 天」退款则失败——即使工具结果里也有 30(那是退货窗口而非退款时限)。
「编程与Agent」频道最新
- 对 AI 说「太慢了,快点」竟然真的生效,开发者直呼 wtf — DanielLockyer · 2026-09-24
- Stripe Link 钱包用户超 3 亿,携手 Muse 推动代理购物走向主流 — jeff_weinstein · 2026-09-24
- 扎克伯格拳馆装摄像头让 agent 看他打 MMA,回合间 1 分钟完成反馈 — victor_explore · 2026-09-24
- 同一套 Fintech UI 提示词,实测 ChatGPT、Claude、Figma Make 三家生成效果 — Tegadesigns · 2026-09-24
- Agent Skills 实用指南:何时该用、如何创建与最佳场景 — rseroter · 2026-09-24
- Agent 会话迁出沙盒后内存降至 0.8MB,Rivet 实测数据公开 — mitsuhiko · 2026-09-24