Yandex Research:把 KV-cache 当运行时,让 LLM 无需训练即可并发交互
RichmanRonald · x · 2026-09-17
Yandex Research 发布博客,探讨如何用 KV-cache 的共享与调度,让预训练 LLM 在不额外训练的情况下同时「观察、推理、行动」。
- 问题:现有模型是顺序处理——推理时停止观察、改轨迹需从头重来,天然不适合游戏、机器人、直播视频等持续变化的环境;交互式系统要求感知、推理、通信、行动异步并发推进
- 现有路线:Wan-Streamer、Thinking Machines Lab 的 Interaction Models 等,共识是顺序工具调用+轮流输入输出不够,但普遍靠改模型本身(预训练、后训练、block-causal attention、流式编码器、策略头)解决
- 本文主张:探索在推理期(inference time)就实现大部分交互行为——把 KV-cache 状态当作可共享、可调度的运行时,让观察与推理并发进行,模型权重完全不动
这是把 agent 交互架构从「模型训练问题」重新定义为「推理时系统设计问题」的思路,值得架构方向的研究者关注。
「编程与Agent」频道最新
- 开发者热议:纯 bash 不再是 agent 可靠工具调用的答案 — yenkel · 2026-09-17
- 日均上线 50 次团队分享:Vibe coding 时代的测试分级与精准测试实践 — dotey · 2026-09-17
- YC 用 GLM-5.2 造出 AI 合伙人,延迟比 OpenAI 低 31% — ycombinator · 2026-09-17
- 给 Claude 直接定制工具形态,胜过用间接层「哄」模型 — trq212 · 2026-09-17
- Codex 额度耗尽有救:换号登录可找回全部聊天记录续用 — TheMoonMidas · 2026-09-17
- Vercel fx 默认安全审查将换用 Jev:比 GPT Luna 快 5-18 倍更准 — thesaraharminta · 2026-09-17