Qwen3.8-27B本地评测:事实提取F1与3.6持平,解码速度降16%
KitchenAmoeba4438 · reddit · 2026-08-15
作者在本地事实提取任务上对比Qwen3.8-27B与Qwen3.6-27B,使用1001条笔记、生产提示词、Q4KM量化等。结果显示Qwen3.8的F1为0.7030,Qwen3.6为0.7177,差异不显著(置信区间包含0),视为平局。解码吞吐从85.6降至72.1 tokens/s(约16%),但Qwen3.8回答更短,端到端延迟更低。作者指出Qwen3.8在训练过的基准上提升巨大,但在其他任务上未见显著增益,质疑基准的有效性。
「模型」频道最新
- Teutonic-I 10B 模型击败 70B 级竞品 — markjeffrey · 2026-08-15
- 用户反馈 Gemini 网页版变弱:拒绝搜索且遗忘上下文 — yenkel · 2026-08-15
- Anthropic 分享构建高性价比 Agent 的技巧 — brada · 2026-08-15
- Bittensor 发布 10B 去中心化 LLM,性能超 18B 竞品 — const_reborn · 2026-08-15
- 修复并改进 Qwen 3.8 聊天模板:解决推理与工具调用问题 — Chromix_ · 2026-08-15
- GLM 5.3 上线 Arena,支持 Battle 和 Agent 模式 — arena · 2026-08-15