27B「海明威」微调模型本地实测:M5 Max 跑出 32 tok/s,角色扮演惊艳
DerTomsn · reddit · 2026-10-02
Reddit 用户在 M5 Max 上实测 Altworld 的 Hemmingway-1(基于 Qwen3.8-27B 微调、主打「类人写作」的 27B 模型,量化版 oQ8e + MTP),开启 thinking 与 MTP 后平均约 31.8 tok/s,显存峰值约 29-31 GB。
LLM judge 分场景评分:
- 角色扮演与叙事:94.2 分,沉浸感每轮 96-97,是唯一突出场景
- 研究分析:88.2
- Agent 工作流:87.5
- 代码生成:76.2
对比测试的基座 Qwen3.8-27B 分数很接近,甚至有一轮反超(95.35 vs 94.65)。但作者指出 LLM judge 本身也不是人类读者:实际阅读产出时差异才显现——微调版的叙事文本明显更有「人味」,文中附了一段酒馆场景的样章作为对比。
「模型」频道最新
- 多方用户实测称请求被路由至 Fable 5.5,最强模型或将发布 — kimmonismus · 2026-10-02
- OpenAI 与 Google 新模型定价完全撞车:$2/$10 每百万 token — AccBalanced · 2026-10-02
- E2B 沙箱日跑 60 万次,撑起 Arena 的模型横评基建 — badphilosopher · 2026-10-02
- OpenAI 再砍额度:500 美元套餐用量不及数月前 100 美元档 — petrusenko_max · 2026-10-02
- Grok 进驻 X 群聊:美国 Premium+ 用户可在群内直接提问 — XFreeze · 2026-10-02
- Burkov:处理无人做过的新任务,LLM 欺骗你的概率有多高 — burkov · 2026-10-02