自建 200 任务数据集实测:Gemma 26B 屠榜,量化后仍居 S 级
Potential-Net-9375 · reddit · 2026-10-03
一位 Reddit 用户用自己日常 agent 任务构建的 200 题自定义数据集,横评了 10 个 2B MoE 到 27B Dense 的模型,给出分级榜单:
- S 级:Gemma-4-26B——即使量化到 iq3s 仍居榜首
- A 级:Qwen3.8-27B(q3/q5,稠密模型但速度慢)、Qwen3.5-9B(意外表现出色)
- B 级:Qwen3.5-4B、Gemma-4-e2b(远超体量的表现)
- C 级:Gemma-4-12B、Nanbeige(性能不够格但太重)
- F 级:Ling-3.0-tiny、MiniCPM
测试题由 Fable 4.1 编写,核心考察模型在作者正在开发的 LLM 集群「Hive」中对自定义工具的正确调用——过重的模型反而拖慢速度,因此要找能力与体量的平衡点。作者提醒结果因人而异(YMMV)。
「模型」频道最新
- Together AI 复盘 AI 大会:开源模型怎么选成全场高频问题 — togethercompute · 2026-10-03
- OpenAI 为付费 ChatGPT 账户全量重置额度,GPT-6.1 Sol 恢复正常速度 — thsottiaux · 2026-10-03
- 传统 nDCG 高分仅 53% 获人类认同,RCP-nDCG 提升至 97% — Nils_Reimers · 2026-10-03
- 传 GPT-6.1 已饱和 FrontierMath Tier 4,并解决 5 个 Erdős 问题 — haider1 · 2026-10-03
- Claude 拦截「think out loud」引发争议:用户吐槽防蒸馏误伤真实思考 — cephaloform · 2026-10-03
- 创作者抱怨 ChatGPT 图像审查随机拦截,呼吁放宽创意限制 — oldboi777 · 2026-10-03