微软研究院推出 Social-R1:用强化学习训练模型的社交推理

burkov · x · 2026-09-30

现代 AI 模型在数学、编程等结构化任务上进步显著,但真正的社交智能——理解微妙的人际线索、推断他人心理状态、选择合适行为——仍是 major hurdle。当前系统常靠表面捷径和模式匹配,而非真正的社交推理,导致在陌生情境或叙事细节稍有变化时决策脆弱、表现崩盘。

微软研究院(MSR)新文章提出了强化学习框架 Social-R1,按人类认知原则对整个逐步推理过程进行监督,培养真正的社交推理能力。为建立可靠的评估与训练环境,研究者还开发了 ToM(心智理论)相关基准(推文在此截断)。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →