Atomic 称量化模型运行时可将 KV Cache 压缩 6.4 倍
testingcatalog · x · 2026-07-23
Atomic 表示,它的运行时专门针对小型量化模型做了优化,因此更适合长任务场景。
它还称,在自家的 TurboQuant llama.cpp 分支里,KV cache 压缩最高可达 6.4 倍,并放出链接邀请用户试用。
「Infra」频道最新
- vLLM 表示 prime-rl 在 28 台 H200 上跑万亿级 agentic RL — vllm_project · 2026-07-23
- GLM-5.2 新增视觉支持并开源,附 SGLang 运行说明 — baseten · 2026-07-23
- 交易员称谷歌 AI 资本开支被错杀,回报率其实很高 — JOBhakdi · 2026-07-23
- DeepSeek 称已拥有约 2 万张 H 等效算力卡,并将继续买 NVIDIA GPU — ShakeelHashim · 2026-07-23
- M5 MacBook Pro 24GB 或 32GB 能跑 27B 本地模型吗 — Adventurous-Gold6413 · 2026-07-23
- 截图显示专门面向“禁售”开源权重模型的种子站 — Promptmethus · 2026-07-23