新论文称 scaffold 只解释了 1.5% 的智能体性能差异
gerardsans · x · 2026-07-21
这条线程把两篇论文放在一起,质疑“agent 外壳”到底贡献了多少能力。
- MORPHEUS(NeurIPS 2026)被引用为结论:scaffold 只解释了 1.5% 的性能差异,而基础 next-token 模型本身解释了 41.4%,大约高出 28 倍。
- 作者据此认为,多智能体协作、CoT 包装、各种 orchestration 层,大多只是围绕同一组冻结权重改变提示词,并没有带来真正的适应能力。
- 回复里又引用 CORRAL(arXiv:2604.18805):在 8 个科学领域、2.5 万+ 条 agent trajectory 里,68% 完全忽略证据,71% 从不更新信念,只有 26% 出现了基于反驳的修正。
- 合起来的结论是:很多“agentic”表现可能只是 scaffold 和叙事制造出的幻觉,而不是模型真的在推理或代理行动。
「漫话AGI」频道最新
- Fields 奖热门人选谈 LLM 辅助数学研究拐点 — stevenstrogatz · 2026-07-21
- 伦敦 9 月 5 日办一场 AI 圈乐观主义野餐 — isnit0 · 2026-07-21
- Gary Marcus:现代数学 AI 是混合系统,不是纯 LLM — GaryMarcus · 2026-07-21
- VC 鼓吹开源 AI 背后:前沿模型垄断正威胁风投生存空间 — chris_j_paxton · 2026-07-21
- AI 时代让人看到,人类常被自尊压过理性 — haider1 · 2026-07-21
- FactoryAI 观点:模型蒸馏几乎已不可阻挡 — LangChain · 2026-07-21