LLM架构之争:学者指带递归与工具的Transformer已非纯DNN
近期AI社区围绕大模型的组合泛化能力及底层架构展开了激烈讨论。学者Alex Zhang指出,现代Transformer在引入外部工具与特定机制后,已突破了传统纯深度神经网络(DNN)的范畴。当前结论认为,递归语言模型(RLM)的神经符号架构是提升模型组合泛化能力的关键,这一讨论重新审视了主流大模型的底层智能逻辑,值得关注。
已确认
- 要点 Alex Zhang明确指出,当Transformer配备了暂存区、上下文卸载、持久上下文(PTC)以及递归调用能力后,其架构已经不再是传统意义上的纯DNN。
- 要点 针对纯神经网络在组合泛化上的缺陷,Alex Zhang认为递归语言模型(RLM)本质上是对提示词的符号引用进行“符号递归”,属于一种神经符号系统。
- 要点 他强调,正是这种符号递归机制让RLM在组合泛化能力上表现优异,而更好的泛化能力应依赖于系统架构的改进,而非仅仅暴力堆砌数据和时长。
尚未确认
- 要点 讨论中对“纯LLM”的严格边界界定仍存在争议。部分声音认为,如果确信仅靠可微操作的DNN就能实现一切智能,需要证明这种网络在纯文本输入输出(不依赖外部工具环境)的任务中,也能展现出与结合了工具环境的智能体相同的扩展和泛化行为。
为什么重要
- 要点 这一讨论直接回应了Yann LeCun和Gary Marcus等人对“纯LLM”的批评。通过厘清现代大模型在工具调用和递归机制上的实质性进化,为评估大模型的真实能力与未来突破方向提供了更严谨的技术视角。
2026-08-06 ~ 2026-08-06 · 5 条相关
一手来源
- Alex Zhang:RLM神经符号架构能显著提升大模型组合泛化能力 — lateinteraction ·
- 带记忆与递归的Transformer已非纯DNN,LLM架构之争再起 — lateinteraction ·
- 探讨深度网络架构:可微操作是否足以实现智能体级泛化 — lateinteraction ·
- 学者激辩:RLM 的符号递归才是组合泛化的关键 — lateinteraction · 2026-08-06
- 【源头】Alex Zhang:RLM神经符号架构能显著提升大模型组合泛化能力 — lateinteraction · 2026-08-06
- 【源头】探讨深度网络架构:可微操作是否足以实现智能体级泛化 — lateinteraction · 2026-08-06
- 学者反驳对纯 LLM 的质疑:带工具与递归的 Transformer 已非纯 DNN — lateinteraction · 2026-08-06
- 【源头】带记忆与递归的Transformer已非纯DNN,LLM架构之争再起 — lateinteraction · 2026-08-06