带记忆与递归的Transformer已非纯DNN,LLM架构之争再起
lateinteraction · x · 2026-08-06
针对近期社区对 LeCun 和 Marcus 批评“纯 LLM”的嘲讽,作者提出了更严谨的技术视角:现代配备了暂存区、上下文卸载、程序思维链(PTC)和递归机制的 Transformer,已经不再是传统意义上的纯深度神经网络(DNN)。
这种架构上的演进正是它们的能力能够超越仅经过 RLHF 微调的早期版本(如 GPT-4)的核心原因。作者呼吁在讨论模型能力边界时,应清晰区分不同的假设类,不应将系统架构的进化与传统的静态网络混为一谈。
所属事件:LLM架构之争:学者指带递归与工具的Transformer已非纯DNN(5 条相关)→
「漫话AGI」频道最新
- 递归自我改进模型何时能通关《战神》? — imjustnewatai · 2026-08-06
- AI 进化拐点将至:人类将成新瓶颈被优化? — aiamblichus · 2026-08-06
- 用电子游戏测试 AI 自我改进:通关、对战与速通的四重基准 — imjustnewatai · 2026-08-06
- 研究者预测 AGI 降临时间更可能为 5 到 10 年内 — jd_pressman · 2026-08-06
- 预测市场设立赌局:前沿大模型 2027 年前会窃取权重自我复制吗? — jd_pressman · 2026-08-06
- 算力即霸权:闭源大厂靠 6GW 算力筑墙,DeepSeek 等总和不足其十五分之一 — zephyr_z9 · 2026-08-06