Agent 的隐性成本在 KV cache:DeepSeek 压到每 token 约 890 字节

altryne · x · 2026-09-12

Chris Alexiuk 指出 agent 运行成本的秘密在于 KV cache:账单大头取决于缓存命中还是未命中,而非算力本身。

DeepSeek 走的压缩路线将 KV cache 压到每 token 约 890 字节,让更多上下文保持"热"状态而不会烧掉 GPU,是控制长上下文 agent 推理成本的关键路径。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →