dioscuri 晒出说服自己的论文:11 个 LLM 心智理论测试超越儿童

dioscuri · x · 2026-10-06

dioscuri 在回复中分享了两份让他「破防」的材料:一篇是 CoNLL 2023 论文《Theory of Mind in Large Language Models》,将 11 个基础与指令微调 LLM 与 7-10 岁儿童在高级心智理论任务上对比,涵盖非字面语言与递归意图等超越经典错误信念范式的测试。结果显示 GPT 系指令微调模型常能超越儿童,而基础模型即便专门提示也难以完成;作者认为语言与心智理论在演化与发展上的交织可解释指令微调的作用。另一份是 drorpoleg 2023 年的博客及 Sparks of AGI 报告中的因果推理实验。他坦言这些证据并非决定性,但足以让他改变了对 LLM 认知能力的看法。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →