469 题实测 Qwen3.8-27B 微调:本地最佳版比 Opus 5.5 慢 28 倍但更省 token

norenEnmotalen · reddit · 2026-10-08

作者用自建 469 题领域评测集,在 llama.cpp、统一思考设置下横向对比多个 Qwen3.8-27B 微调与前沿模型:

结论:选模型要按自己领域跑 eval,「PTA 指数」(时间/token/正确率)可作为个人基准 KPI。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →