Swift 1.5 比 Qwen3.8 27B 少写三成 token,M5 Max 跑 34.8 tok/s
DerTomsn · reddit · 2026-09-30
作者在 Apple M5 Max 64GB 上用 MLX 通过 llm-bench.io 实测 Swift-1.5-Qwen3.8-27b(262k 上下文、thinking 开到 xhigh),并与原版 Qwen3.8 27B 对比:
- 生成量:Swift 全流程平均 5.1 万 token,Qwen3.8 为 7.7 万,主要省在代码生成(2.86万 vs 4.01万)和研究(1.11万 vs 2.12万)环节;Swift 约 3/4 输出仍是推理内容,只是更精简
- 速度与质量:生成速度 34.6 vs 32.8 tok/s,prompt 处理均约 400 tok/s,LLM judge 质量分 85.8 vs 85.0,在多次运行的方差范围内算打平
- 总耗时:完整基准跑 Swift 平均 24 分钟,Qwen3.8 需 38 分钟
结论:质量持平的前提下,Sweet 因少写冗余推理而快三分之一,作者准备拿它当日常主力模型试几天。文中附了全部 8 次基准运行的原始链接。
「Infra」频道最新
- Miles v0.1.1 发布:Multi-LoRA 共享基座,原生支持 Claude Code 智能体训练 — ying11231 · 2026-09-30
- vLLM 支持 RAM offload,4 张 R9700 本地跑通 DeepSeek-V4 视觉实验版 — sloptimizer · 2026-09-30
- 四台 Mac Studio 本地跑 1T 参数 FP4 模型,硬刚订阅 API — DimitrisPapail · 2026-09-30
- NVIDIA 发布 Nemotron Labs:在 DGX Spark 本地跑 Nemotron 模型 — NVIDIAAI · 2026-09-30
- AI 基础设施或走向分布式电网而非少数巨型电厂 — sarahookr · 2026-09-30
- Efficient Computer 融资 9700 万美元,号称能耗效率领先 10 倍 — rebeccakaden · 2026-09-30