17 岁少年优化 llama.cpp:两块 80 美元 Tesla P100 跑 Qwen 达 60 tps
Kmic68 · reddit · 2026-09-28
一位 17 岁开发者发布了针对 Tesla P100 显卡(二手约 80 美元)的 llama.cpp kernel 优化,用两块 P100 以 q6k 量化运行 Qwen(27B)实现约 50-60 tps decode:
- 性能提升:0 context decode 从 7-15 tps 提到 50-60;260k 长 context 从 2-4 tps 提到 30-35;prefill 从 220 tps 提到 350,260k context 下从 40 提到 110 tps
- 工程细节:用混合 fp16/fp32 数学修复 fp16 舍入误差;对回归测试极严格,数学结果必须更精确或字节级一致才通过
- 部署要点:对启动 flag 敏感,需 -c 262144 -b 32768 -ub 1024 -np 1,否则 MTP acceptance 会崩到接近 0
- 已于 9 月 22 日合并,支持 Qwen flash 架构;受限于 175W 功耗墙和散热瓶颈,良好散热下预计还能再提 5-10%
作者提供了完整的构建文档、数学证明与测试,欢迎 PR。
「Infra」频道最新
- Modal 免费放出 GPU 术语小册子,Gergely 实体书抢先晒 — charles_irl · 2026-09-28
- 测算:Meta Muse 服务 1 亿日活或需 1-4GW 算力 — SuB8u · 2026-09-28
- 2007 年 $350 旧主机实测跑赢 $1500 RTX 5070,内存速度不重要? — Truth-Does-Not-Exist · 2026-09-28
- 免校准 4-bit 量化法 TQ 开源:Qwen 27B KLD 仅 0.0282 — textclf · 2026-09-28
- GPU 抵押贷款比数据中心贷款贵 1.2 个点: lender 只信活得过芯片代际的资产 — rohanpaul_ai · 2026-09-28
- Yacine 爆料:单 GPU 实现 8K 世界每秒千万帧渲染 — yacineMTB · 2026-09-28