DeepSeek V4.1-Flash 滑窗重放省显存,长程召回会掉吗
Top-Handle-5728 · reddit · 2026-09-11
Reddit 帖主提出对 DeepSeek-V4.1-Flash 中 SWA Bounded Replay 机制的技术疑问:该设计不持久保存滑窗 KV 缓存,而是丢弃后仅用最后 Nwindow 个 token 近似重建,以大幅节省显存。
帖主的核心质疑是:原始 SWA 状态因网络深度而拥有远大于窗口宽度的有效感受野,重建出的 K/V 向量缺少塑造原始状态的长程上下文,因此缓存命中或会话重启后的前几轮交互可能出现召回精度损失;并追问并行的全局 KV 增强是否足以弥补这一近似误差。帖主征求是否有人做过相关 benchmark 或观察到实际召回退化。
「模型」频道最新
- GPT-6 Astra 首次尝试即驱动机器人臂,Ken Goldberg 点赞 Agentic Robotics — zhaoran_wang · 2026-09-11
- OpenAI 内部模型被称已证明 Navier-Stokes 千禧年难题 — QuintinPope5 · 2026-09-11
- 曝 DeepSeek 4.1 flash 也用超大 ngram 词嵌入,架构酷似 Qwen4 — ccerrato147 · 2026-09-11
- ValsAI 发布 RSI Index:首个第三方基准测试模型自研继任能力 — JenniferHli · 2026-09-11
- Assistant Benchmark 上线:61 款 AI 助手 15 个维度实测横评 — Scobleizer · 2026-09-11
- Astra 太能打:OpenAI 暂停 $200 ChatGPT Pro 新订阅,算力不够用了 — 机器之心 · 2026-09-11