27B 本地模型实测:Dirk-Qwen3.8 全面碾压 Swift-1.5 同底模
norenEnmotalen · reddit · 2026-10-01
作者用自建领域评测集(约 200+ 题,涵盖编码、numpy/pandas、数据分析决策、本地 RAG、语音助手)在 M1 Max 32GB 上对比两个同基于 Qwen3.8-27B 的量化模型:
- 配置:Dirk-Qwen3.8-27B-UD-Q4KXL(128K 上下文)vs Swift-1.5-Qwen3.8-27B-Q4KL(110K),运行在魔改版 Splash 推理栈上
- 结果出乎意料:Dirk 明显更 Sharp,响应更快、token 消耗更省、答对更多;Swift-1.5 常在难题上反复输出直到撞上 16384 max token 截断失败
- 即使排除截断失败的题,Dirk 的 token 效率也更高;作者排除了 prompt 缓存假象
- 关键差异之一:每次传入 chat template 的 "be brief" 指令效果远超预期,在代码重构任务中同样成立
- 作者还补充:目前唯一通过他全部评测包的是 Claude Opus 5.5,Deepseek Flash 4.1 fp32 仅错 3 题
对关注本地部署与量化选择的人有直接参考价值。
「Infra」频道最新
- Epoch AI 报告:同等 AI 性能成本每季降 47%,年降约 13 倍创历史最快 — dl_weekly · 2026-10-01
- Magnitude:自适应调优的开源推理引擎,号称比 llama.cpp 快至 2 倍 — paranoidray · 2026-10-01
- Google Spanner Omni 正式 GA:可部署在任何地方的分布式数据库 — rakyll · 2026-10-01
- Meta 把数据中心报成试验设施,研发税收抵免暴增至 39 亿美元 — mkheck · 2026-10-01
- Ben Bajarin:推理时代内存成 2000 亿美元拐点的系统架构问题 — BenBajarin · 2026-10-01
- Google 研究副总裁:捐款盖楼不如资助高校算力云 — jasondeanlee · 2026-10-01