自建 200 任务数据集实测:Gemma 26B 屠榜,量化后仍居 S 级

Potential-Net-9375 · reddit · 2026-10-03

一位 Reddit 用户用自己日常 agent 任务构建的 200 题自定义数据集,横评了 10 个 2B MoE 到 27B Dense 的模型,给出分级榜单:

测试题由 Fable 4.1 编写,核心考察模型在作者正在开发的 LLM 集群「Hive」中对自定义工具的正确调用——过重的模型反而拖慢速度,因此要找能力与体量的平衡点。作者提醒结果因人而异(YMMV)。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →