Artificial Analysis 发布手机端小模型智能与推理基准
Artificial Analysis 与 Liquid AI 合作发布了面向移动设备的小模型智能与推理基准测试,在 iPhone 17 Pro 和 Galaxy S26 Ultra 等真机上测试多款 4-bit 及以下精度的模型,智能评测的上下文被限制为 16K 以模拟手机内存约束。评测显示,模型间的智能差距远小于效率差距,端侧部署的瓶颈更多在内存与速度。
已确认
- 智能评测包含五项评估,衡量小模型在函数调用、知识和推理方面的表现;推理基准则在真机上测量速度、延迟和内存占用。
- 在 16K 上下文限制的综合评测中,Nanbeige4.2-3B (Reasoning) 和 LFM2.5-2.6B (Reasoning) 以平均 63 分并列第一;Qwen3.5 9B 拿下 BFCL 和 GPQA Diamond 单项领先。
- 效率差距巨大:iPhone 17 Pro 上 4K 上下文的峰值内存占用从 0.4GB(LFM2.5-230M)到 6.9GB(Ornith-1.0-9B 和 Qwen3.5 9B),相差约 19 倍;对 12GB 内存的手机而言,近 7GB 占用意味着严重挤占系统资源。
- 生成 256 个 token 的端到端耗时从 0.9 秒(LFM2.5-230M)到 26.7 秒(Falcon-H1R-7B),相差约 30 倍;性能榜领先的两款模型耗时也明显更长。
- 达到约 60 分成绩所需的 token 消耗差异显著:Qwen3.5 9B (Reasoning) 消耗 74.5M 输出 tokens,且有 29% 的生成超出 16K 窗口限制;Gemma 4 E4B 在同等分数下 token 消耗更少,效率更优。
为什么重要
- 该基准首次系统量化了小模型在真机上的智能-效率权衡:跑分接近的模型,实际内存与耗时体验可能相差一个数量级,这对端侧选型(尤其是 12GB 级内存的量产手机)更具参考价值。
- 结果同时揭示长思维链推理模型在端侧的适配难题:超出上下文窗口的生成(如 Qwen3.5 9B 的 29%)会直接截断输出,影响可用性。
2026-08-25 ~ 2026-08-25 · 8 条相关
一手来源
- Artificial Analysis 发布手机端小模型基准测试 — ArtificialAnlys ·
- 手机端模型榜首出炉:南边贝格与 LF M2.5 并列第一 — ArtificialAnlys ·
- 手机模型内存占用差 19 倍,9B 模型占近 7GB — ArtificialAnlys ·
- 端侧大模型评测:LFM2.5 效能领跑 iPhone — ArtificialAnlys · 2026-08-25
- 【源头】手机端模型榜首出炉:南边贝格与 LF M2.5 并列第一 — ArtificialAnlys · 2026-08-25
- Qwen3.5 手机端耗Token过高,Gemma 4 效率更优 — ArtificialAnlys · 2026-08-25
- 手机端模型耗时差 30 倍,LFM 最快仅需 0.9 秒 — ArtificialAnlys · 2026-08-25
- 【源头】手机模型内存占用差 19 倍,9B 模型占近 7GB — ArtificialAnlys · 2026-08-25
- 【源头】Artificial Analysis 发布手机端小模型基准测试 — ArtificialAnlys · 2026-08-25
- Artificial Analysis 携手 Liquid 推出手机端模型评测 — JosephJacks_ · 2026-08-25
- LiquidAI 联手发布手机端小模型评测基准 — JosephJacks_ · 2026-08-25