Studio Jadu 用「难缠合成用户」测试 AI 助手,把 eval 当头等大事
andimarafioti · x · 2026-09-23
Studio Jadu 团队分享:他们在用生成的合成用户来测试自己的 AI 助手——故意造出「非常烦人、非常没耐心」以及配合型等多种性格的虚拟用户,覆盖真实交互中的极端场景。
作者强调,从第一天起 evals(评测)就是团队的核心优先级,合成用户是其测试方法的一部分。
「编程与Agent」频道最新
- 实战指南:如何在编程 Agent 中调用 Gemini API 技能 — patloeber · 2026-09-23
- Redis 推出 Radar 与 Search on Flex 等面向 Agent 的新能力 — antirez · 2026-09-23
- shuding 博客长文:隐喻即函数,协议把 n×n 变 n+n — shuding · 2026-09-23
- 开发者实测 Opus 5.5:Bedrock 上明显强于 Opus 5 — FlolightC · 2026-09-23
- 实测 Grok-4.7-high 一天:写分布式锁必死锁,工程能力不敌 GPT-5.6 — karminski3 · 2026-09-23
- Opus 5.5 降价后算账:40 轮任务成本几何,缓存命中是省钱关键 — xiaohu · 2026-09-23