专题 · FULL STORY
jev 评委模型:集成到实测验证
Kitaru 宣布集成 TypeSafe 的 jev 评委模型,可对 Agent 会话轨迹打分;随后开发者通过修改 48 个会话逐字段对照实测,揪出 8 个幻觉退款时限,验证其抓取编造信息的能力。
2026-09-24 ~ 2026-09-24 · 2 集 · 4 条
第 1 集 · Kitaru 集成 jev 评委,低成本抓出 Agent 编造信息(2026-09-24,2 条)
Kitaru 宣布集成 TypeSafe 的 jev 评委模型,可直接对从 tracing provider 导入的 Agent 会话和轨迹打分,弥补此前仅有确定性评估的不足。strickvl 演示了其价值:一个客服 Agent 退款后告诉客户「3-5 个工作日到账」,但其调用的工具均不包含退款时长信息,属于编造,而现有规则检查仍给该会话打了 1.00 满分。
- Kitaru 集成 TypeSafe jev 评委:为 Agent 会话轨迹打分更便宜 — strickvl · 2026-09-24
- 规则检查打 1.00 满分,却漏掉客服 Agent 编造的退款时限 — strickvl · 2026-09-24
第 2 集 · 实测 jev 评委:48 个会话揪出 8 个幻觉退款时限(2026-09-24,2 条)
strickvl 对 TypeSafe 的 jev 评委模型进行了系列实测:通过逐字段修改 48 个 Agent 会话做对照,发现来自政策工具的「30 天」能通过评判,而客服向客户口头承诺「30 天」退款则被判失败,证明 jev 并非机械匹配数字。他还展示了用 JSON 文件配置 jev 评委的方法,jev 对时间线问题给出 p(yes)=0.93 并判会话失败,可从 tracing provider 导入数据打分。
- 规则检查打满分也漏掉的幻觉:jev 评委 JSON 配置示例 — strickvl · 2026-09-24
- 48 个 Agent 会话中揪出 8 个幻觉退款时限,jev 评委实测 — strickvl · 2026-09-24