手机端模型榜首出炉:南边贝格与 LF M2.5 并列第一

ArtificialAnlys · x · 2026-08-25

在 16K 上下文限制下的综合评测中,Nanbeige4.2-3B (Reasoning) 和 LFM2.5-2.6B (Reasoning) 以平均 63 分并列第一。具体表现上,Qwen3.5 9B 拿下了 BFCL 和 GPQA Diamond 高分,Falcon-H1R-7B 在 MATH-500 上取得 97% 分数,而 LFM2.5-2.6B 表现出极低的幻觉率(79%)。Nanbeige4.2-3B 虽未在单项中夺魁,但凭借在多项评测中的前五成绩赢得了综合并列第一。

所属事件:Artificial Analysis 发布手机端小模型智能与推理基准(8 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →