两天优化翻倍:DeepSeek 本地部署 16K prefill 冲到 1820 tok/s
HankYeomans · x · 2026-10-09
一位开发者分享了自己本地部署 DeepSeek 推理的优化进展("Frankenstein" 自组方案):
- 任务为 16K prefill,两天前成绩 860 tok/s、耗时 18.6 秒;
- 优化后达到 1820 tok/s、8.8 秒,两天内吞吐翻倍、延迟近乎减半。
虽未给出具体方法,但对做本地大模型部署调优的人是个有意思的速度参考点。
「Infra」频道最新
- 月付 500 美元 API 账单逼人自建:Mac Studio 对决双 DGX Spark — rodrigodevbits · 2026-10-09
- Agent 基础设施初创 Solari 发布:浏览器 8ms 启动,比 Browserbase 快 10 倍 — Scobleizer · 2026-10-09
- ARK 分析师:「没有高收入低能耗国家」的流行图表只是时间点快照 — skorusARK · 2026-10-09
- Splash 1.3.0 上线:SSD 卸载让本地 agent 首 token 从 19 秒降到 1 秒 — BeidiChen · 2026-10-09
- 不改模型不换硬件,LunaRoute 把 GLM 交互延迟从 2.7 秒降到 0.4 秒 — dbreunig · 2026-10-09
- fal 联手 a16z 办 AI Infra Day,四家生成式 AI 基础设施团队同台 — gorkem · 2026-10-09