专题 · FULL STORY

jev 评委模型:集成到实测验证

Kitaru 宣布集成 TypeSafe 的 jev 评委模型,可对 Agent 会话轨迹打分;随后开发者通过修改 48 个会话逐字段对照实测,揪出 8 个幻觉退款时限,验证其抓取编造信息的能力。

2026-09-24 ~ 2026-09-24 · 2 集 · 4 条

第 1 集 · Kitaru 集成 jev 评委,低成本抓出 Agent 编造信息(2026-09-24,2 条)

Kitaru 宣布集成 TypeSafe 的 jev 评委模型,可直接对从 tracing provider 导入的 Agent 会话和轨迹打分,弥补此前仅有确定性评估的不足。strickvl 演示了其价值:一个客服 Agent 退款后告诉客户「3-5 个工作日到账」,但其调用的工具均不包含退款时长信息,属于编造,而现有规则检查仍给该会话打了 1.00 满分。

第 2 集 · 实测 jev 评委:48 个会话揪出 8 个幻觉退款时限(2026-09-24,2 条)

strickvl 对 TypeSafe 的 jev 评委模型进行了系列实测:通过逐字段修改 48 个 Agent 会话做对照,发现来自政策工具的「30 天」能通过评判,而客服向客户口头承诺「30 天」退款则被判失败,证明 jev 并非机械匹配数字。他还展示了用 JSON 文件配置 jev 评委的方法,jev 对时间线问题给出 p(yes)=0.93 并判会话失败,可从 tracing provider 导入数据打分。