dioscuri 晒出说服自己的论文:11 个 LLM 心智理论测试超越儿童
dioscuri · x · 2026-10-06
dioscuri 在回复中分享了两份让他「破防」的材料:一篇是 CoNLL 2023 论文《Theory of Mind in Large Language Models》,将 11 个基础与指令微调 LLM 与 7-10 岁儿童在高级心智理论任务上对比,涵盖非字面语言与递归意图等超越经典错误信念范式的测试。结果显示 GPT 系指令微调模型常能超越儿童,而基础模型即便专门提示也难以完成;作者认为语言与心智理论在演化与发展上的交织可解释指令微调的作用。另一份是 drorpoleg 2023 年的博客及 Sparks of AGI 报告中的因果推理实验。他坦言这些证据并非决定性,但足以让他改变了对 LLM 认知能力的看法。
「模型」频道最新
- 在提示词前加「Okay」可让 Olmo-3-7B 的 MATH-500 准确率从 42% 升至 78% — arankomatsuzaki · 2026-10-06
- Anthropic 最佳策略是沉默憋大招?网友热议 OpenAI 自乱阵脚 — weswinder · 2026-10-06
- 博主吐槽新模型发布将被 Qwen 4 27B 碾压,小 8 倍性能反超 — gnukeith · 2026-10-06
- 128GB M5 Mac 本地大模型实测:Qwen3.8-flash-next 90GB 内跑到 60 tok/s — surrealerthansurreal · 2026-10-06
- Mistral 发布 Large 4:1T 参数多模态模型对标中美对手 — TechCrunch AI · 2026-10-06
- 重度 Claude 用户谈 Gemini 4 Argon:写码难替 Claude,UI 又太陌生 — MicahBerkley · 2026-10-06