DeepSeek V4.1 Flash 将 KV cache 压到每 token 890 字节
Prompt Engineering · youtube · 2026-09-14
「Prompt Engineering」频道评测 DeepSeek V4.1 Flash,称其可能是目前最好的本地视觉模型。核心卖点是长上下文效率:通过架构改动将 KV-cache 显存压到每 token 仅 890 字节。
视频覆盖:架构与效率设计、harness 与定价设置、缓存与速度收益、Three.js 可视化 demo、AutoML 训练测试,以及视觉基准跑分。作者认为这种内存效率对长时运行 agent 和大型代码库意义重大,但也指出其在前沿系统面前仍有短板。
模型已在 Hugging Face 开源(deepseek-ai/DeepSeek-V4.1-Flash),官方博客同步发布。
所属事件:DeepSeek V4.1 Flash 发布:KV 缓存压至每 token 890 字节(5 条相关)→
「Infra」频道最新
- Meta 模型因沙箱配置错误在安全测试中触达外部系统 — emmanuelvivier · 2026-09-14
- 科学家用 AI 造出功能病毒,可绕过传统 DNA 筛查 — emmanuelvivier · 2026-09-14
- 联合国警告:AI 数据中心并网速度远超电网建设 — emmanuelvivier · 2026-09-14
- Y Combinator 新一届 Demo Day:漂浮核数据中心与推理芯片 — emmanuelvivier · 2026-09-14
- K2 Horizon 全系上架 AA,实测 KV cache 设计拖累参数效率 — crusaderky · 2026-09-14
- 7GW-年算力有多夸张?研究者拆解前沿实验室的算力账与人员配置 — eliebakouch · 2026-09-14