新论文称 scaffold 只解释了 1.5% 的智能体性能差异
gerardsans · x · 2026-07-21
这条线程把两篇论文放在一起,质疑“agent 外壳”到底贡献了多少能力。
- MORPHEUS(NeurIPS 2026)被引用为结论:scaffold 只解释了 1.5% 的性能差异,而基础 next-token 模型本身解释了 41.4%,大约高出 28 倍。
- 作者据此认为,多智能体协作、CoT 包装、各种 orchestration 层,大多只是围绕同一组冻结权重改变提示词,并没有带来真正的适应能力。
- 回复里又引用 CORRAL(arXiv:2604.18805):在 8 个科学领域、2.5 万+ 条 agent trajectory 里,68% 完全忽略证据,71% 从不更新信念,只有 26% 出现了基于反驳的修正。
- 合起来的结论是:很多“agentic”表现可能只是 scaffold 和叙事制造出的幻觉,而不是模型真的在推理或代理行动。
「漫话AGI」频道最新
- Anthropic 内部爆料:并非人人都持高 p(doom) 灾难论 — anpaure · 2026-09-11
- 前 OpenAI、Anthropic 预训练研究员辞职:两公司正赌上人命冲向自我改进超级智能 — ShakeelHashim · 2026-09-11
- 一万个智能体能否突破反向传播,找到更好的学习算法 — SeunghyunSEO7 · 2026-09-11
- AI 陪伴的隐秘代价:它消解了建立真实亲密关系所需的摩擦 — YogeshMalik · 2026-09-11
- Wired 深度解析:为何众多 AI 研究者担心机器威胁人类生存 — wiredmagazine · 2026-09-11
- 「幻觉」或是范畴错误:把 AI 叫智能正在限制我们的想象 — Genaforvena · 2026-09-11