469 题实测 Qwen3.8-27B 微调:本地最佳版比 Opus 5.5 慢 28 倍但更省 token
norenEnmotalen · reddit · 2026-10-08
作者用自建 469 题领域评测集,在 llama.cpp、统一思考设置下横向对比多个 Qwen3.8-27B 微调与前沿模型:
- Opus 5.5 以 99.6% 正确率登顶,但无模型达到 100%;本地最优为 mradermacher/Signal-3.8-27B-Terse-Coder.i1-Q4KM,Q4KM 量化版跑赢 L/XL 量化,意外发现。
- 速度差距巨大:本地模型整卷约 9 小时 vs 前沿约 19 分钟(28 倍),但换来的是完全隐私(本地 vs 前端 0 隐私)。
- Astra 提供商疑似隐藏推理过程,token 用量最低但存在疑点;OpenRouter 部分提供商不披露量化,作者呼吁强制披露。
- gpt-oss-120b 在 pandas/numpy 任务上表现糟糕,说明只有领域评测才能暴露模型盲区。
- 评测工具已开源:github.com/ashe-wb/tuieval,可复用于自建领域测试。
结论:选模型要按自己领域跑 eval,「PTA 指数」(时间/token/正确率)可作为个人基准 KPI。
「编程与Agent」频道最新
- DeLM 更新版实测:多智能体快 2.49 倍但评测口径各异 — jyangballin · 2026-10-08
- Musk 认可 Grok 机器人 + Cursor 云端 Agent 组合,称效率飙升 — elonmusk · 2026-10-08
- 开发者感叹:AI 编程时代,缩进与格式之争彻底失去意义 — facontidavide · 2026-10-08
- RunningTab 论文:让环境侧记账 Agent 读过什么、还欠什么任务 — RexDouglass · 2026-10-08
- 开发者:当下最值得学的技能是让隔夜 agent 稳定跑通不翻车 — zack_overflow · 2026-10-08
- UIUC 团队发布 Relic:多智能体组织协议可跨成员持续积累 — youjiaxuan · 2026-10-08