RTX 3090 实测:模型装得下选 llama.cpp,装不下 FreeToken 首字快 7 倍
SignatureMoney6648 · reddit · 2026-10-01
Reddit 用户在单张 RTX 3090 上对比了 FreeToken 与 llama.cpp 两个推理引擎(1024 输入 / 256 输出,并发 1–32)。
- 模型装得进显存时(Gemma-4-26B-A4B,同一 GGUF):llama.cpp 吞吐高 2.2–3.2 倍,首 token 延迟快 5–6 倍;FreeToken 0.1.2 甚至无法把 4-bit 专家留驻显存,8 并发即 OOM
- 模型装不下时(gpt-oss-120b,63GB):FreeToken 首字延迟稳定在约 9 秒,而 llama.cpp 从 17 秒恶化到 58 秒;32 并发时为 19 秒 vs 139 秒,吞吐两者持平(10–17 tok/s)
- 溢出到系统内存会让生成速度掉约 10 倍,两种引擎皆然
- 作者的 PCIe 3.0 主板可能构成瓶颈,FreeToken 全程 PCIe 打满,号召有人用 PCIe 4.0 主板复测
「Infra」频道最新
- Dwarfstar 定制量化:Qwen 在 96GB M3 Ultra 上跑得又快又稳 — TheRealJesus2 · 2026-10-01
- Micron 财报预判差 19 亿美元,分析师复盘模型错在哪 — tengyanAI · 2026-10-01
- HBM 链条挤压效应:美光 540 亿美元季度带动整条封装产能 — demian_ai · 2026-10-01
- DeepSeek V4.1-Flash 将 KV 缓存压至每 token 890 字节,持久缓存缩 8 倍 — jbhuang0604 · 2026-10-01
- Cognitive Revolution 播客:AWS GPU 租价 3 倍溢价与 AI 诊断罕见病 — The Cognitive Revolution · 2026-10-01
- Cognitive Revolution 周报:AWS GPU 贵 3 倍、AI 诊断罕见病与中美 AI 外交 — The Cognitive Revolution · 2026-10-01