手机端模型耗时差 30 倍,LFM 最快仅需 0.9 秒

ArtificialAnlys · x · 2026-08-25

在 iPhone 17 Pro 上的实测显示,生成 256 个 token 的端到端耗时在不同模型间差异巨大,最快仅需 0.9 秒(LFM2.5-230M),最慢达 26.7 秒(Falcon-H1R-7B)。性能领先的两款模型耗时分别为 8.0 秒和 21.4 秒。此外,达到约 60 分的评测分数可能消耗 5M 到 75M 不等的输出 tokens,其中 Qwen3.5 9B 因高耗量和 16K 窗口限制在手机端面临挑战。

所属事件:Artificial Analysis 发布手机端小模型智能与推理基准(8 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →