Mind2Dialogue:模拟用户心理状态训练「懂人」的语言模型
Zixuan Wang · hf · 2026-09-16
新框架 Mind2Dialogue 试图弥合 LLM 训练中的监督鸿沟:现有助手数据几乎不含基于用户未言明信念与目标的回应,而用户内心状态又不可直接观测。
- 方法:先用心理学引导的模拟器生成保持个人特征、心理状态随交互演化的对话;核心是一个共享且不断更新的心智状态,同时驱动模拟用户行为与「全知 Oracle 助手」的回应。
- 特权蒸馏:让模型在部署时虽看不到用户心智,却学到 Oracle 那种「知情回应」。
- 评估:结合个性化与心理理论(theory of mind)两个维度。
- 结果:相对 Qwen、Llama、OLMo 指令微调基线,全指标提升,偏好遵循生成提升 26.6–40.9 个百分点,且信念与行动推理能力同步增强。
「研究」频道最新
- USC 新讲义:「谱视界」理论预测有限数据下模型何时反超,给出 AUC 闭式缩放律 — PTenigma · 2026-09-16
- 论文实测:工具仅仅可用就让学生模型答题率从 98.2% 跌到 63.5% — dair_ai · 2026-09-16
- 16 天 85 万次调用实验:多智能体系统无一人扛住三类压力测试 — Deepak Akkil · 2026-09-16
- 《人类建造的最后一代 AI》论文提出递归自我改进路线图 — Yi Duan · 2026-09-16
- 云天励飞前员工?不,是邓侃云的 ProgramAsWeights:英语「编译」成神经小程序 — yuntiandeng · 2026-09-16
- 14 步手推 Sora 的 DiT:提示词与时步只靠缩放和平移注入 — ProfTomYeh · 2026-09-16