「模型通过 KV cache 传消息」?这条推文质疑了流行说法

scaling01 · x · 2026-09-04

针对「模型能通过 KV cache 传递比 token 空间复杂得多的消息」这一流行说法,scaling01 提出质疑:KV cache 只是给定上下文下的内部状态,如果不用 cache 而是每次重算所有状态,会得到完全相同的结果——它并没有启用任何额外的信息传递,只是节省了计算量。这触及一个值得辨析的问题:把思维链看作模型内部过程的代理可能具有误导性,而所谓「KV cache 里的隐秘消息」或许并不存在额外的通信通道。

所属事件:层重复架构疑云引发 CoT 可监控性激辩(7 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →