曝 DeepSeek V4.1 Flash 将 prefill/decode 分离直接写入模型权重
altryne · x · 2026-09-11
- 据Chris Alexiuk 透露,DeepSeek V4.1 Flash 把预填充(prefill)与解码(decode)的分离做法直接「烘」进了模型本身,而不只是停留在推理服务栈层面。
- prefill 与 decode 是两种性质不同的计算任务,业界通常在 serving 层做 disaggregated 架构;若属实,把这一拆分内置到权重中是相当非常规的设计。此消息为第三方转述,未经官方证实。
所属事件:曝 DeepSeek V4.1 Flash 将 prefill/decode 分离直接写入模型权重(2 条相关)→
「Infra」频道最新
- 推理瓶颈在带宽而非算力,Positron 反转 GPU 设计路线解析 — lemire · 2026-09-11
- Oracle 未上调债务预期股价大涨,评论称其本质是 GPU 大宗服务生意 — TiernanRayTech · 2026-09-11
- 97.5% 缓存命中率仍藏一半账单:六 Agent 公司实测省钱 59% — Icy_Comfort_6220 · 2026-09-11
- 华为发布近封装光学新标准,挑战英伟达与博通 — pstAsiatech · 2026-09-11
- Redis 只作缓存就关掉快照和日志,磁盘占用大幅下降 — DanielLockyer · 2026-09-11
- AI 利润大涨,美光给台湾 1.5 万员工每人约 3.2 万美元奖金 — Polymarket · 2026-09-11