Decagon 工程师指出:模拟用户太"配合",正在污染客服 Agent 评测基准

kastnerkyle · x · 2026-09-13

Decagon 分享文章《GEPA-GAN: Teaching AI to Sound Human》,指出在客服 Agent 领域,评估常依赖模拟用户,这使模拟器本身成了基准的一部分:如果模拟出来的客户比真实用户更干净、更有耐心、更配合,评测结果就会系统性偏乐观。文章讨论如何让模拟用户更接近真实人类的说话方式,以保证评测的有效性。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →