让大模型冷呼推销保险:SalesBench 评估长周期智能体
hamostaf04 · x · 2026-08-02
开发者针对长周期智能体与智能体间交互缺乏评估手段的问题,推出了名为 SalesBench 的沙盒测试框架。
- 测试场景:模拟真实的销售管线,由一个 Seller Agent 充当销售员,通过冷呼向 LLM 扮演的买家推销保险线索。
- 评估维度:智能体需要在长周期的交互中管理时间、工具和状态,最终以实际促成的营收作为评分标准。
- 初步成果:作者基于该环境训练了一个 2B 参数的模型,并已在多个前沿大模型上完成了基准跑分测试。
「编程与Agent」频道最新
- Codex 智能体在足球模拟游戏中打出 38-0 完美战绩 — talkaboutdesign · 2026-08-02
- 实测:利用AI挖掘出全新CVE漏洞 — bronzeagepapi · 2026-08-02
- AI编程工具对比:Codex降价反衬Fable额度吃紧 — robleclerc · 2026-08-02
- Agensis更新:桌面端化身Relay,支持多Agent并行 — jasonkneen · 2026-08-02
- AI 编码实践:人工代码审查正让位于 QA 测试 — talkaboutdesign · 2026-08-02
- 开发者自嘲:频繁折腾 AI 编码框架,最终仍回归 Cursor — brandon_galang · 2026-08-02