为什么每轮都把完整对话发给推理服务器?Reddit 热议服务端 KV 槽位 API 设想
Vasili_Sk · reddit · 2026-10-09
Reddit 用户质疑当前 LLM 推理服务的上下文管理范式:应用层每轮都把整段对话历史重发给服务器,让服务器自行匹配 KV cache 槽位、做 checkpoint 恢复、避免 KV 失效,各 harness 还要各自实现 compaction。
作者认为这像「每次发消息都重传整个 WhatsApp 历史」,并提出应把上下文变成服务端对象:
- createslot() / sendmessage(slot, msg) / deleteslot(slot) / compact(slot) / setcachepolicy(slot)
- 线性 agent 对话无需分支 checkpoint,直接声明即可省内存
- 让服务器管理 KV 的冷热与 SSD/RAM 卸载
核心论点:KV cache 是「已完成的计算结果」,不是对话历史本身;推理服务器应像数据库一样提供 create→append→query→compact→delete 的状态接口,而不是逼应用重放历史再猜哪些算过。作者诚心求证是否有根本性原因使此路不通。
「编程与Agent」频道最新
- 程序员对时间的 60 个错误假设,这份经典清单永不过时 — aronchick · 2026-10-09
- 高中生发文探讨 AI 辅助编程的「验证鸿沟」,征资深工程师反馈 — Adventurous-Fox3386 · 2026-10-09
- AI 一口气为 OpenAI 722 篇数学预印本生成讲解视频,共 93 小时 — jeffgrimes9 · 2026-10-09
- Text-to-SQL Agent 踩坑实测: critic 分离成本涨 53% 却零收益 — renatyv · 2026-10-09
- SWEeper-Bench:测 AI agent 能否在用户发现前扫清按需软件的 bug — liuzhuang1234 · 2026-10-09
- Jev 风格分类器:让 Agent 自建快速分类器替代微调的工程实践 — vesko_st · 2026-10-09