scaling01 补充:KV cache 不启用任何信息传递,只省计算
scaling01 · x · 2026-09-04
在关于「模型通过 KV cache 传递消息」的讨论中,scaling01 进一步明确自己的观点:KV cache 并没有启用什么、对信息传递并不重要,它的作用只是节省一些计算量。不存在绕过 token 空间的额外通信通道,相关表述容易造成误解。
「研究」频道最新
- 斯坦福论文提出 CST 训练法:让 CoT 忠实度监控准确率提升 35 个点 — a_karvonen · 2026-09-04
- 斯坦福 Prefix Sliding:只留前缀和滑窗,推理提速约 3 倍不重训 — rohanpaul_ai · 2026-09-04
- Wharton 实验:2.6 万次测试显示购物 Agent 建议随上下文变得不可预测 — emollick · 2026-09-04
- Tivadar Danka 整理全套机器学习数学资源库免费开放 — TivadarDanka · 2026-09-04
- teortaxesTex:「能力型基准已死」,一切评测取决于环境 — teortaxesTex · 2026-09-04
- 博客提出「好奇心驱动树搜索」,自称可扩展的 AlphaZero 替代方案 — CatAstro_Piyush · 2026-09-04