Decagon 工程师指出:模拟用户太"配合",正在污染客服 Agent 评测基准
kastnerkyle · x · 2026-09-13
Decagon 分享文章《GEPA-GAN: Teaching AI to Sound Human》,指出在客服 Agent 领域,评估常依赖模拟用户,这使模拟器本身成了基准的一部分:如果模拟出来的客户比真实用户更干净、更有耐心、更配合,评测结果就会系统性偏乐观。文章讨论如何让模拟用户更接近真实人类的说话方式,以保证评测的有效性。
「编程与Agent」频道最新
- SlopCodeBench 全量跑分出炉:Astra 领先但优势有限 — cedric_chee · 2026-09-13
- 超宽屏 + 平铺窗口管理器:21:9 上并排跑浏览器与 Codex/Cursor — mark_k · 2026-09-13
- Claude Code 提示词专项抑制 Opus 5 过度自我纠错 — repligate · 2026-09-13
- 开发者吐槽:有 agent 编程了,我照样把自己埋进坑里几周 — lucasmeijer · 2026-09-13
- Linus 的真正才华不是写内核,而是当「指挥」——AI 编程的正确范式 — ricklamers · 2026-09-13
- Perplexity 驱动 ChatGPT 与终端:本地模型 + GLM 5.3 混合编排实测 — ChrisUniverse · 2026-09-13