scaling01 补充:KV cache 不启用任何信息传递,只省计算

scaling01 · x · 2026-09-04

在关于「模型通过 KV cache 传递消息」的讨论中,scaling01 进一步明确自己的观点:KV cache 并没有启用什么、对信息传递并不重要,它的作用只是节省一些计算量。不存在绕过 token 空间的额外通信通道,相关表述容易造成误解。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →