Yandex 研究:不改权重,靠重组 KV cache 让 LLM 实时交互
arpit_bhayani · x · 2026-09-07
Yandex Research 发表研究,把 KV cache 从单纯的推理加速手段变成模型的「主动记忆运行时」,在不改动模型权重的前提下让 LLM 具备交互能力。
核心机制
- KV cache 通常只被视为速度优化,但它实际决定了模型能看到什么、以什么顺序看到。
- 做法是让一块共享记忆被多个「读者」以不同顺序读取:同一份存储不复制、不重写,只改变各读者看到的页序。
由此实现的能力
- 多个模型实例共享同一记忆,彼此实时看到对方的进展,无需等完整回答。
- 一个模型可同时扮演两个角色:一部分持续思考,另一部分边说边用已就绪的内容,二者互相感知并随时调整。
Demo:Yandex 展示了一个玩《Doom》的 agent——模型在推理和选动作的同时持续接收游戏画面流,全部跑在同一套共享内存机制上。该模型从未在 Doom 上训练过,仅靠重新组织其记忆的暴露方式就实现了实时行动。
作者总结:交互性未必来自重训练,改变模型记忆的组织与共享方式是一个远比想象便宜的杠杆。
所属事件:Yandex 研究:KV cache 可作 agent 实时运行时(3 条相关)→
「Infra」频道最新
- vLLM 投机解码上线 AMD MI300X/MI355X,多 token 并行验证降延迟 — petrusenko_max · 2026-09-07
- 传三星与 Arm 联合开发端侧芯片,OpenAI 为最终客户 — morqon · 2026-09-07
- Hugging Face datasets 流式近似洗牌获大幅提速 — lhoestq · 2026-09-07
- Actian 发布嵌入式向量库对比,Qdrant 指其自家推荐也非真嵌入式 — qdrant_engine · 2026-09-07
- 格陵兰 15Mbps 月费 $124,Starlink 丹麦 200Mbps 仅 $57 引热议 — XFreeze · 2026-09-07
- Red Hat 携手 Hugging Face 在班加罗尔办 PyTorch 系统技术之夜 — PyTorch · 2026-09-07