为什么每轮都把完整对话发给推理服务器?Reddit 热议服务端 KV 槽位 API 设想

Vasili_Sk · reddit · 2026-10-09

Reddit 用户质疑当前 LLM 推理服务的上下文管理范式:应用层每轮都把整段对话历史重发给服务器,让服务器自行匹配 KV cache 槽位、做 checkpoint 恢复、避免 KV 失效,各 harness 还要各自实现 compaction。

作者认为这像「每次发消息都重传整个 WhatsApp 历史」,并提出应把上下文变成服务端对象:

核心论点:KV cache 是「已完成的计算结果」,不是对话历史本身;推理服务器应像数据库一样提供 create→append→query→compact→delete 的状态接口,而不是逼应用重放历史再猜哪些算过。作者诚心求证是否有根本性原因使此路不通。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →