27B「海明威」微调模型本地实测:M5 Max 跑出 32 tok/s,角色扮演惊艳

DerTomsn · reddit · 2026-10-02

Reddit 用户在 M5 Max 上实测 Altworld 的 Hemmingway-1(基于 Qwen3.8-27B 微调、主打「类人写作」的 27B 模型,量化版 oQ8e + MTP),开启 thinking 与 MTP 后平均约 31.8 tok/s,显存峰值约 29-31 GB。

LLM judge 分场景评分:

对比测试的基座 Qwen3.8-27B 分数很接近,甚至有一轮反超(95.35 vs 94.65)。但作者指出 LLM judge 本身也不是人类读者:实际阅读产出时差异才显现——微调版的叙事文本明显更有「人味」,文中附了一段酒馆场景的样章作为对比。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →