Yandex 研究:不改权重,靠重组 KV cache 让 LLM 实时交互

arpit_bhayani · x · 2026-09-07

Yandex Research 发表研究,把 KV cache 从单纯的推理加速手段变成模型的「主动记忆运行时」,在不改动模型权重的前提下让 LLM 具备交互能力。

核心机制

由此实现的能力

Demo:Yandex 展示了一个玩《Doom》的 agent——模型在推理和选动作的同时持续接收游戏画面流,全部跑在同一套共享内存机制上。该模型从未在 Doom 上训练过,仅靠重新组织其记忆的暴露方式就实现了实时行动。

作者总结:交互性未必来自重训练,改变模型记忆的组织与共享方式是一个远比想象便宜的杠杆。

所属事件:Yandex 研究:KV cache 可作 agent 实时运行时(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →