MiniCPM5-2B 登顶 4B 以下开源模型榜,2.6B 拿下智能指数 15 分
ArtificialAnlys · x · 2026-09-07
Artificial Analysis 评测显示,OpenBMB 的 MiniCPM5-2B 在 Intelligence Index v4.2 拿下 15 分,是总参数 4B 以下开源权重模型的最高分。
关键结论
- 该模型为 2.6B dense 推理模型,仅支持文本,131k 上下文,Apache 2.0 开源。
- 15 分领先同尺寸 Granite 4.2 3B(11 分)4 分;以少 44% 的参数追平 Qwen3.5 4B(Reasoning,14 分),并持平约 4 倍大的 Qwen3.5 9B(15 分)。
- 智能体能力突出:GDPval-AA v2 Elo 831 领跑 <4B 模型,比 Ling 3.0 Tiny(718)高约 110 分;τ³-Banking 与 Ling 3.0 Tiny 并列第一(21%);AA-Briefcase 438 分排第二。
- 短板:知识、编码与长上下文偏弱,HLE 仅 9%,Terminal-Bench v2.1 9%,CritPt 0%。
- 低幻觉策略:AA-Omniscience 仅尝试 29% 的题,非幻觉率 78%,因此得 -12 而非大幅扣分。
- 省 token:每任务仅用 19k 输出 token(11k 为推理),与 Granite 4.2 3B 并列最低,远低于 Ling 3.0 Tiny 的 56k——这对端侧/边缘部署很关键。
所属事件:OpenBMB 开源 MiniCPM5-2B,登顶 4B 以下模型智能榜(4 条相关)→
「模型」频道最新
- 网友排定 AI 编程能力线:Claude 3.5 过中位数,Opus 4.5 达 SWE 均值 — menhguin · 2026-09-07
- GPT-6 Astra Pro 登顶 Simple-Bench:86.5% 首超人类基线 — koltregaskes · 2026-09-07
- Fable 5.1 登顶 MathArena 榜单第二,但仍不敌更便宜的 GPT Astra — gabrielchua · 2026-09-07
- 用户实测:找具体二手商品 Gemini 成功 Claude 称不存在 — HankYeomans · 2026-09-07
- Astra 真比 mythos/fable 强吗?Reddit 质疑「AGI 时刻」只是营销 — miltonian3 · 2026-09-07
- OpenRouter 用量年增 27 倍,成观察 AI 需求的重要风向标 — jeff_weinstein · 2026-09-07