微软研究院推出 Social-R1:用强化学习训练模型的社交推理
burkov · x · 2026-09-30
现代 AI 模型在数学、编程等结构化任务上进步显著,但真正的社交智能——理解微妙的人际线索、推断他人心理状态、选择合适行为——仍是 major hurdle。当前系统常靠表面捷径和模式匹配,而非真正的社交推理,导致在陌生情境或叙事细节稍有变化时决策脆弱、表现崩盘。
微软研究院(MSR)新文章提出了强化学习框架 Social-R1,按人类认知原则对整个逐步推理过程进行监督,培养真正的社交推理能力。为建立可靠的评估与训练环境,研究者还开发了 ToM(心智理论)相关基准(推文在此截断)。
「研究」频道最新
- NVIDIA/MIT 推 Physis-Lang:语言进化让视频模型物理分涨 5.5 分 — songhan_mit · 2026-09-30
- LeCun 参与推出 AD-E2E-JEPA:世界模型免训练策略端到端自动驾驶 — ylecun · 2026-09-30
- 三篇论文揭示 LLM 难做代码复杂度优化,RL 训练找到突破口 — TimDarcet · 2026-09-30
- 机器人策略元数据条件化实验失败:文本提示被完全忽略 — DominiqueCAPaul · 2026-09-30
- 研究者:放弃「一切皆需可微」或解锁 AI 下一步突破 — PMinervini · 2026-09-30
- 写作评测暗藏刷分漏洞:逐样本 rubric 或被训练过程反向拟合 — teortaxesTex · 2026-09-30