实测拆穿 Gufo 70 tok/s 宣传:重复词基准虚高,日常仅 39 tok/s
brainchillzZ · reddit · 2026-10-02
作者实测开源推理引擎 Gufo 在 Strix Halo 上跑 Qwen 27B Q4 的「70 tok/s」宣传,复现成功但发现关键水分:
- 虚高来源:宣传数字用「写 red 1000 次」这种重复 prompt,投机解码的草稿模型每次都猜对,速度全靠它;正常 prompt 草稿命中率约一半,实测中位仅 39.4 tok/s(22–52 浮动)。
- 聚合数字也有水分:所谓 8 用户 123 tok/s 是各请求速度相加、不计排队;按每秒实际吐出的 token 算只有 82(重复)/52(正常)。
- 与 halogen 对比:同硬件下 halogen 日常单用户快约 13%(43.9 vs 38.2),4 用户端到端快约 18%(76.6 vs 63.1);Gufo 仅长 prompt 处理(1495 vs 1288 tok/s)和重复 prompt 占优。
- 公道话:数字并非造假,官方文档有 mixed/repetitive 分列且混合成绩对得上,只是 README 只放最优;无草稿模型时约 12 tok/s,39 仍是不错水平。
- Gufo 其他优点:接受普通 GGUF、MIT 协议、27B 加载约 3 秒、日志含草稿命中与缓存信息、支持 8 路并发批处理,还带 ASR/TTS/图像能力。
「Infra」频道最新
- a16z 拆解 AI 基建资金流向:每 100 美元 50 个进芯片,20 个进电力 — demian_ai · 2026-10-02
- 数据库老兵押注负载感知推理:批处理 LLM 任务可省大量重复计算 — sh_reya · 2026-10-02
- GPU 开销去哪了:训练、推理还是闲置? teams 的真实账单讨论 — Borges_Engineer · 2026-10-02
- SemiAnalysis:16% 的 Rubin 计算裸片面积耗在 HBM 控制器与 PHY 上 — BenBajarin · 2026-10-02
- Modal Clusters 正式上线:RDMA 节点按秒计费,一个装饰器起集群 — josh_wills · 2026-10-02
- Benchmark领投芯片初创Tendrils Compute,估值或超10亿美元 — Sethwinterroth · 2026-10-02