IBM Tejas Kumar 深度工作坊:LLM 评测如何骗过你及四种常见陷阱
AI Engineer · youtube · 2026-10-06
AI Engineer 频道发布 IBM 的 Tejas Kumar 一场约一小时的评测(Evals)实战工作坊,现场演示 LLM 评测为何比看起来更难:
- 失败案例开场:一条客服回答因包含 "cannot" 一词通过了断言测试,实际上却批准了违反店铺政策的退货——普通断言与模糊匹配在此失效
- 演化路径:从失败样例逐步构建 LLM judge、场景数据集(含 agent 回复与人工判定),过程中发现 judge 会偏袒自家模型家族生成的答案(self-preference)
- judge 的四种失真:位置偏差(position bias)、谄媚(sycophancy)、自偏好、冗长偏好——评测工具本身也需要用人工判定做校准
- 工程化要点:用 80% 一致率阈值设为 CI 门禁;需持续用新鲜流量与人工复核更新数据集;部署前检查与运行时 harness 防护要区分;先做确定性检查,再为模型判断付费
- OpenRAG 演示:检索最新上传的退货政策,替代埋在 prompt 里的静态规则
核心结论:绿灯测试不等于系统可用,要持续审视分歧样本、补充上下文,必要时更换模型。
所属事件:IBM 工程师开讲:LLM 评测四大陷阱与上线标准(2 条相关)→
「编程与Agent」频道最新
- 像招新员工一样配置你的 Grok 智能体:一次只给一个任务 — alex_verem · 2026-10-07
- ChatGPT 接入 Netlify 事件:表单自动回访、部署变更自动播报 — thisiskp_ · 2026-10-07
- Superconductor 推出 Connectors:一次接入 Linear、Sentry、Figma 供全组 Agent 取上下文 — sergeykarayev · 2026-10-07
- Nous Research 推出 Hermes Index 智能体榜单,Claude Opus 5.5 居首 — NousResearch · 2026-10-07
- Coinbase 上线 Agent 交易新功能:模板、TWAP 订单与 MCP 接入 — kleffew94 · 2026-10-07
- Dreadnode 发布 ScopeBench:评测 agent 是否守攻击范围 — dyn___ · 2026-10-07