曝 DeepSeek v4.1 长上下文提速:32K prefill 吞吐提升约 40%
HankYeomans · x · 2026-10-11
用户 HankYeomans 晒出一组自称 DeepSeek v4.1 的性能测试数据(未官方证实):
- 16K prefill:吞吐从 2,195/2,345 tok/s 提升至 2,934/3,264 tok/s(冷/热,约 +34%/+39%),TTFT 从 7.32s 降到 5.48s。
- 32K prefill:吞吐从 2,499/2,612 提升至 3,532/3,508 tok/s(约 +41%/+34%),TTFT 从 12.81s 降到 9.06s。
总体看长上下文 prefill 阶段的吞吐和首 token 延迟均有三到四成的改善。数据来源为个人实测,真实性待确认。
「Infra」频道最新
- zml_ai 编译优化:模型冷启动从 45 分钟缩至 3 分钟 — steren · 2026-10-12
- 本地大模型推理正走向多卡并行,GPU 互联带宽成关键变量 — Dathide · 2026-10-12
- Project Maya 让 321B GLM-5.3-Flash 跑在单张消费级 GPU 上 — inthesearchof · 2026-10-12
- 16GB 显存本地部署选型:模型、推理优化与新推理服务器三线演进 — ECrispy · 2026-10-12
- 一张用量截图晒出 1100+ 台云虚拟机,最大单账户建了 738 台 — aniketmaurya · 2026-10-12
- AMD Strix Halo 本地跑 AI 写规格:qwen 慢 5-10 倍但活真能干完 — julianharris · 2026-10-12