Cognition与OpenRouter深度对谈:别让小模型硬撑,智能体路由与上下文缓存怎么搞
AI Engineer · youtube · 2026-08-07
模型路由的陷阱与解法
- 小模型越界代价高昂:Alex Atallah (OpenRouter) 指出,将小模型用于其训练分布外的任务会导致其陷入死循环(如疯狂调用工具),最终算力成本反而超过直接使用昂贵的大模型。
- 静态路由很脆弱:Walden Yan (Cognition) 认为,随着会话深入(例如从代码库问答演变为实时调试),初始选择的最优模型可能会变得力不从心。
- Cognition 的解法:让前沿大模型负责高层规划,将具体实现下放给更廉价的模型。这不仅削减了 40% 的成本,还能利用省下的算力并行派出多个子智能体探索代码库。
上下文与缓存优化
- 保持 KV Cache 温热:Cognition 避免使用多个子智能体,转而采用具备连续上下文的“sidekick”模式,使缓存 token 的成本降低约十倍。
- 压缩的隐性代价:Yan 强调,上下文压缩应当是为了提升智能而非单纯省钱。因为压缩会触发缓存未命中(cache miss),且模型质量在远未达到标称的百万 token 窗口前就会发生断崖式下跌。
「编程与Agent」频道最新
- 分析工具调用错误可修复半静默故障 — morgymcg · 2026-08-07
- 实测 13 款 Agent 搜索 API:隐藏 Token 费用相差 67 倍 — Patient-Injury-1327 · 2026-08-07
- AI Toolkit 推出 MiniMax H3 蒸馏适配器,训练更快更稳 — ostrisai · 2026-08-07
- BrainOS:为多 Agent 工作流打造跨工具持久记忆 — jacksummer_ · 2026-08-07
- PocketJS 新作:ESP32 上跑满血 pi harness,嵌入式设备也能自进化 — dotey · 2026-08-07
- AI 智能体自主调度多模型,完成微电影《LOVE》全流程 — LudovicCreator · 2026-08-07