微软论文揭示 AI 谈判代理因太礼貌而吃亏
rohanpaul_ai · x · 2026-08-23
微软新研究发现,现有 AI 代理因训练导向(乐于助人、透明)在谈判中表现不佳,常泄露预算并在对方施压时妥协。仅靠提示词(prompting)优化反而会加剧问题。
核心方案 SocialRL:
- 基于六个谈判/调度游戏的最终交易结果进行强化训练,而非仅在对话层面优化。
- 效果显著: 仅 4B 参数的小模型在训练后,学会了锚定低价、坚持立场并拒绝糟糕交易。
- 性能对标: 在所有六项游戏中平均得分达 0.627,与 GPT-4.1 (0.625) 持平。
对开发者的启示:
构建代理时,评估指标不应只看是否达成交易,更要看“让渡了多少利益”。
「编程与Agent」频道最新
- 给 AI Agent 多少自主权?先看沙箱里证明了什么 — HaktanSuren · 2026-08-24
- Matt Shumer 因 Agent 封号?警惕账号共享风险 — PrajwalTomar_ · 2026-08-24
- Qwen 3.8 27B 模型在 Agent 任务中自主调用视觉 QA — awitod · 2026-08-24
- 研究揭示:优化 Scaffolding 可让弱模型逼近前沿水平 — rohanpaul_ai · 2026-08-24
- AI agent说“完成”就真的完成了吗?开发者探索独立验证机制 — singed_of_a_down3 · 2026-08-24
- Flare:图优先IDE,实时可视化agent编码过程 — AlgoWithNoRhythm · 2026-08-24