DeepMind 研究员:大模型如同无索引图书馆,每次预测需遍历全部参数
iamtrask · x · 2026-07-30
DeepMind 研究员 Andrew Trask 用生动的比喻解释了大语言模型的工作机制与未来架构演化。
- 当前机制:他将 GPT-3 等模型比作一个没有索引的图书馆。为了回答问题(如“国际象棋的规则是什么”),模型几乎需要“阅读”每一个神经元(相当于每本书的每一页),才能输出一个 token。
- 未来演化:如果所有知识最终能被高度压缩,模型最终可能演化为“一本书”;但如果知识本质上是分布式存在的,为了平衡计算成本与准确性,底层数据结构最终将不得不发生改变以适应这一特性。
「研究」频道最新
- UIUC 提出 Agent Primitives:多智能体协作提速 4 倍且省 Token — jiqizhixin · 2026-07-30
- 多模态上下文学习评测基准 CLBench-V 发布,最强模型得分不足 0.3 — Lai Wei · 2026-07-30
- 图解AI底层逻辑:向量嵌入与大模型记忆机制 — _jaydeepkarale · 2026-07-30
- 研究表明智能体框架可大幅提升 LLM 组合泛化能力 — lateinteraction · 2026-07-30
- 摆脱 API 调用者,斯坦福 CS336 大模型从零构建课程 — techNmak · 2026-07-30
- 斯坦福等提出 Handroid:可在人形与灵巧手间变形的机器人 — carlosdponx · 2026-07-30