解惑:LLM生成每个token都要跑一遍全部参数吗
MarinatedPickachu · reddit · 2026-08-31
- 一个常见困惑:以稠密模型(非 MoE)为例,生成每个输出 token 时,是否整个网络的所有激活参数都被重新执行、同样的权重被重新读取?
- 还是有部分计算按短语或段落级别只做一次,之后每个 token 只触及部分参数?
- 这是理解 Transformer 自回归推理与 KV cache 机制的基础问题,预计会引发技术讨论。
「Infra」频道最新
- 黄仁勋联合资管巨头筹 5000 亿美元,打通 GPU 算力融资链 — RachelVT42 · 2026-08-31
- 开发者对比 Mujoco 与 Isaac:定位与功能差异解析 — KyleMorgenstein · 2026-08-31
- 英伟达豪赌实体 AI,中国成大客户却面临禁令悖论 — pstAsiatech · 2026-08-31
- 为 M5 Ultra 512GB 备战:本地跑大模型的下载清单与量化选择 — Ok_Warning2146 · 2026-08-31
- 华为将推 Kirin 2026 处理器,采用 LogicFolding 架构 — pstAsiatech · 2026-08-31
- 华为上半年营收增 9.55%,R&D 投入占比 25% — pstAsiatech · 2026-08-31