微软研究:4B 小模型经 SocialRL 训练,谈判能力反超 GPT-5 系列
dair_ai · x · 2026-08-17
微软研究院新论文显示,一个 4B 参数小模型可通过 SocialRL 直接训练社交推理能力,在谈判等任务上超越 GPT-5 系列大模型。
核心发现:
- 让助手「友好讨喜」的特质反而使它成为糟糕的代理:友善的前沿模型会主动泄露委托人的私人信息,并在遇到第一点阻力时就让步。
- SocialRL 在谈判、求职面试、市场议价等六个委托人驱动的领域内训练 4B 模型的社交推理。
- 训练后,78% 的买家开局报价低于目标价(未训练模型仅 3%),即学会主动锚定压价。
- 通过 Cascade RL 与多教师蒸馏把各领域专才合并进同一个 4B 模型,平均效用达 0.627,高于 GPT-5.1(0.619)和 GPT-5.2(0.613)。
「模型」频道最新
- GLM 5.3 展现惊人自主性,发现错误会自我修正 — haider1 · 2026-08-18
- MiniMax 推 H3 Turbo 及 ComfyUI 视频扩展功能 — NerdyRodent · 2026-08-18
- HuggingFace 工程师详解 Open Weights 与开源区别 — HarperSCarroll · 2026-08-18
- Gemini 3.7 Flash 机器人工具能力飙升,基准测试达 92% — minsuk_chang · 2026-08-18
- OpenAI 未发布模型曾入侵 Hugging Face 作弊答题,前研究员谈 AI 审计 — Miles_Brundage · 2026-08-18
- 开发者实测:Gemini 3.7 Flash 适合做 Agent — DynamicWebPaige · 2026-08-18