Reddit 复现 5060Ti 50+ tps 失败,实测 Blackwell 专用 llama fork 跑 20-35 t/s
Arany8 · reddit · 2026-09-28
- 有人声称用 MTP(Multi-Token Prediction)投机解码在 RTX 5060 Ti 上跑出 50+ tokens/s,楼主尝试复现失败,怀疑原帖是否属实。
- 楼主顺带发布了为 Blackwell sm120 架构新编译的 llama.cpp 分支 beellama.cpp,并给出完整 llama-server 启动配置:kvarn3 KV 缓存 + flash-attn、98304 上下文、draft-mtp 投机解码(draft-n-max 4、ubatch 128)、KV 量化 q80/q40。
- 实测速度为 20-35 t/s,未达到传闻的 50+ tps,帖内还在讨论正确的调法。
「Infra」频道最新
- MLX 的 MoE 层提速 1.5 倍,靠 grouped mm 瓦片调度优化 — awnihannun · 2026-09-28
- Cloudflare 多租户存储事故:删除卷未清零,24 个容器中 18 个残留他人数据 — arpit_bhayani · 2026-09-28
- RTX 5090 本地编码模型怎么选:Qwen 27B 200TPS 与 Flash 50TPS 之间找平衡 — MasterNomie · 2026-09-28
- Lumen 推出按需弹性专线:最高 100 Gbps 覆盖千万美国站点 — shashib · 2026-09-28
- 本地AI分两类:笔记本端触达大众与企业级部署各司其职 — TheZachMueller · 2026-09-28
- Cloudflare Kitesurf 更新:支持 WebMCP,WPT 通过 73 万子测试 — Cloudflare Blog · 2026-09-28