4 张 RTX 3080 跑 Qwen3.6-27B,约 2000 美元可达 69 tok/s
starkruzr · reddit · 2026-07-23
作者在 Vast AI 上用 4 张 20GB RTX 3080 跑 Qwen3.6-27B 做代码生成测试,结论是这套组合的性价比非常高。
- 在接近最大上下文(256K)下,开启 MTP 后 decode 速度约 69 tokens/s
- 关闭 prompt cache、在最大上下文下,prefill 降到 893
- 作者估算:显卡大约 每张 400 美元,整机(主板 + CPU + 64GB 内存等)约 2000 美元
- 结论是:一台廉价的 4×3080 机器 就能高效跑 dense 模型,量化需求低,几乎没有明显性能损失
「编程与Agent」频道最新
- TerraLingua 公开上线,让自治 Agent 进入持久世界 — kenneth0stanley · 2026-07-23
- 一个 Ordinals 市场据称完全用 AI 工具搭建 — adamamcbride · 2026-07-23
- 给编码 Agent 做评测的实用流程:代码库、trace 和用户反馈 — EdenEmarco177 · 2026-07-23
- Sierra 内部 Agent 先卡在上下文获取 — blaizedsouza · 2026-07-23
- AI skill 只有每天能用、能换模型、维护便宜才值得留 — Numerous-Service-980 · 2026-07-23
- GPT-5.6 Sol 和 Fable 5 在游戏里造车实测 — Angaisb_ · 2026-07-23