手机端模型榜首出炉:南边贝格与 LF M2.5 并列第一
ArtificialAnlys · x · 2026-08-25
在 16K 上下文限制下的综合评测中,Nanbeige4.2-3B (Reasoning) 和 LFM2.5-2.6B (Reasoning) 以平均 63 分并列第一。具体表现上,Qwen3.5 9B 拿下了 BFCL 和 GPQA Diamond 高分,Falcon-H1R-7B 在 MATH-500 上取得 97% 分数,而 LFM2.5-2.6B 表现出极低的幻觉率(79%)。Nanbeige4.2-3B 虽未在单项中夺魁,但凭借在多项评测中的前五成绩赢得了综合并列第一。
所属事件:Artificial Analysis 发布手机端小模型智能与推理基准(8 条相关)→
「模型」频道最新
- 从 Anthropic 风险报告外推:2026 年底前难现递归自我改进 — peterwildeford · 2026-08-25
- 英伟达 AVO 智能体 ARC-AGI-3 满分,被指基准已过拟合 — DanielKhashabi · 2026-08-25
- 神秘模型 Ox Alpha 登陆 FutureSim,号称比肩国产前沿模型 — maksym_andr · 2026-08-25
- 通义 Qwen3.8-27B 跻身前沿模型行列 — wandb · 2026-08-25
- ComfyUI 节点实现 MiniMax H3 与 Krea2 嫁接 — Key-Philosopher-9327 · 2026-08-25
- 计划自费百美元 benchmark Qwen 量化与 KV 缓存 — m_mukhtar · 2026-08-25