手机端模型耗时差 30 倍,LFM 最快仅需 0.9 秒
ArtificialAnlys · x · 2026-08-25
在 iPhone 17 Pro 上的实测显示,生成 256 个 token 的端到端耗时在不同模型间差异巨大,最快仅需 0.9 秒(LFM2.5-230M),最慢达 26.7 秒(Falcon-H1R-7B)。性能领先的两款模型耗时分别为 8.0 秒和 21.4 秒。此外,达到约 60 分的评测分数可能消耗 5M 到 75M 不等的输出 tokens,其中 Qwen3.5 9B 因高耗量和 16K 窗口限制在手机端面临挑战。
所属事件:Artificial Analysis 发布手机端小模型智能与推理基准(8 条相关)→
「Infra」频道最新
- Nebius 上线 NVIDIA Groq 3 LPX,Rubin 系统每兆瓦 agent 吞吐提升至 30 倍 — demian_ai · 2026-08-25
- FreeToken 引擎发布:8GB 显存即可跑 290B 边缘 MoE 模型 — Saboo_Shubham_ · 2026-08-25
- Meta 出租 AI 基础设施难成云巨头,专家泼冷水 — DavidLinthicum · 2026-08-25
- 测试显示 Qwen 3.8 27B 在低比特量化下表现优于高比特 — rohanpaul_ai · 2026-08-25
- Atomic Chat 发布 Qwen 3.8 27B GGUF 量化模型集合 — rohanpaul_ai · 2026-08-25
- 微软数据中心遭低估?分析称 5 亿美元资产被 Appeal 至 2.5 亿 — WillRinehart · 2026-08-25