早期研究称 GPT-4 心智理论测试达到甚至超过人类水平
emollick · x · 2026-08-18
沃顿教授 Ethan Mollick 转发了自己早前的推文:一篇研究显示 GPT-4 在一系列心智理论(Theory of Mind)测试中达到、有时甚至超过人类水平,仅在识别「社交失言」时表现不佳——而进一步分析发现这其实是安全护栏拦截造成的,并非能力缺陷。
他在补充回复中还提到另一个实际问题:高级 LLM 的工作产出常夹带只对创建者有意义的信息(如旧草稿痕迹),对用户而言是干扰。
所属事件:LLM 心智理论达人类水平,但多视角处理仍有局限(4 条相关)→
「模型」频道最新
- METR 发布 OpenAI/Hugging Face 黑客事件独立调查:智能体协作内幕 — JeffLadish · 2026-09-22
- JevBench v1.3.0 发布:原版 Jev 以 74.4 分仍居首,47 个竞品逼近 — airesearch12 · 2026-09-22
- 开源模型 MiMo 挑战 Mario 基准,画面跑出搞笑效果 — TheMoonMidas · 2026-09-22
- Aikido 发布开源安全模型 Altar-1,单节点 4 张 H200 即可部署 — Thom_Wolf · 2026-09-22
- ChatGPT 新语音模式遭实测吐槽:乱插话还卡死不动 — nptacek · 2026-09-22
- 传 OpenAI 将在 DevDay 发布对标 Grok 机器人产品 — imjustnewatai · 2026-09-22