Nanbeige 4.2-3B 在多项基准上领先 Qwen 和 Gemma
teortaxesTex · x · 2026-07-22
Nanbeige 4.2-3B 放出了一组相当亮眼的基准成绩,配图将它和 Qwen 3.5、Gemma 4 等模型做了对比。
- 这是一款 4B 总参数 / 3B 非嵌入参数 的小模型。
- 图里展示的成绩里,它在多项 agent、代码和推理测试上都很靠前:
- GDPval rubrics:74.3
- Agent-IF-Oneday:67.5
- Office-QA-Pro:21.1
- Pinch-Bench-V2:74.7
- SWE-Bench Verified:63.6
- Terminal-Bench 2.0:44.1
- HLE w/o Search:17.8
- GPQA-Diamond:87.4
- HMMT-Feb-2026:82.8
所属事件:Nanbeige4.2-3B 发布,Looped Transformer 架构主打 Agent 能力(5 条相关)→
「模型」频道最新
- 第三方实测:DeepSeek V4.1 Flash 达 GPT-6 Astra 98% 分,成本仅 1.4% — ayushtweetshere · 2026-09-11
- TheZhi 发起调查:Fable 5.1 与 Astra 发布后,编码模型选择变了吗 — TheZvi · 2026-09-11
- antirez 谈 Anthropic 禁止未成年人使用 Claude — antirez · 2026-09-11
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- RTX 3060 全本地语音助手复刻 GPT Live 官方演示,6 分钟跑完全程 — liampetti · 2026-09-11
- 曝 Meta Muse Agent 内置邀请码逻辑,或携额外免费额度上线 — testingcatalog · 2026-09-11