动态路由专家迁移:从 VRAM 到 RAM 的自适应优化
antirez · x · 2026-08-17
该实现包含自适应逻辑,能根据过去的 token 生成使用情况,将路由的专家从 VRAM 迁移到 RAM,从而保证热门集合驻留在显存中。作者表示将在有限的两周访问时间内进一步优化,以减少上下文增加时的斜率。
所属事件:Redis作者优化DeepSeek V4推理速度达45 t/s(3 条相关)→
「Infra」频道最新
- 比特币算力超全球超算500倍,Bittensor以此切入推理 — markjeffrey · 2026-08-17
- Bittensor子网118新增超廉价推理,整合多家AI服务 — markjeffrey · 2026-08-17
- Meta 2026 年起将依赖英伟达 Blackwell 与 AMD Helios 算力 — Beth_Kindig · 2026-08-17
- Wici One 声称通过 NVMe 流式传输解决本地显存瓶颈 — Torodaddy · 2026-08-17
- antirez优化DwarfStar:Station上170 t/s生成,22k tokens/s预填充 — antirez · 2026-08-17
- 算力淘金热:CoreWeave 季度营收超早期巨头云厂商 — a16z · 2026-08-17