Muennighoff 算账:KV 压缩丢掉 262GB 只留 20KB
Muennighoff · x · 2026-10-11
Muennighoff 在 MIT NLP Seminar 演讲(主题:Infinite test-time scaling 与 prefix sliding)后补充一笔记账:假设 32 层稠密模型、4096 隐藏维度、bf16、500K 上下文、5K 压缩窗口,KV cache 约 262GB,而 compaction 压缩后只剩约 20KB——丢掉 262GB 换来 20KB,效率极低。
他认为 compaction 虽能让模型长时间自主工作数周去解决难题,但效率太差;「最终 boss」是用别的机制取代 compaction。
所属事件:OpenAI 研究员 MIT 开讲无限测试时扩展(3 条相关)→
「Infra」频道最新
- 访谈 NVIDIA 推理专家:GPU 退役时机与 AI 基础设施经济账 — kimmonismus · 2026-10-11
- 独立研究者修复 Pallas TPU 已知 bug:位级正确且快 1.67 倍 — Francis_YAO_ · 2026-10-11
- AI agent 调优 Triton kernel,翻转 grid 顺序换来 1.29x 推理提速 — zmkzmkz · 2026-10-11
- 囤了 12 万美元 GPU 的 ML 工程师:只因好玩,不劝人跟风 — TheZachMueller · 2026-10-11
- 迁移 AI 工作负载常意味着 70% 以上重写,成本远超预期 — DavidLinthicum · 2026-10-11
- 本地跑 Qwen3.8-Flash-Next 编程实测:5090 上 11 分钟跑赢 Claude Code — dh7net · 2026-10-11