Swift 1.5 比 Qwen3.8 27B 少写三成 token,M5 Max 跑 34.8 tok/s

DerTomsn · reddit · 2026-09-30

作者在 Apple M5 Max 64GB 上用 MLX 通过 llm-bench.io 实测 Swift-1.5-Qwen3.8-27b(262k 上下文、thinking 开到 xhigh),并与原版 Qwen3.8 27B 对比:

结论:质量持平的前提下,Sweet 因少写冗余推理而快三分之一,作者准备拿它当日常主力模型试几天。文中附了全部 8 次基准运行的原始链接。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →