StepEdge发布:端侧模型加速下沉
AGI Hunt · wechat · 2026-07-12
端侧模型正在加速“下沉”
文章先借 r/LocalLLaMA 的趋势图讨论:从前沿云端模型到可在笔记本/手机本地运行的开源模型,能力追平大约平均需要 24.8 个月。作者据此推测,未来两年端侧模型会迎来一轮明显爆发,因为本地运行带来的价值不只是“更强”,还包括断网可用、低延迟、隐私和地区可用性。
StepEdge:面向手机和汽车的端侧家族
阶跃星辰在 WAIC 上推出 StepEdge,定位为“1+N”架构:一个文本+视觉底座,外加 Audio、GUI、Gen 三个多模态模型,面向手机和汽车等终端。官方强调它支持低至 100ms 的本地 tool call,简单任务本地响应、复杂任务上云。
评测与系统工程
文章列出多项结果:基础模型在图像理解、GUI Grounding、OCR、工具调用、AppAgent 等 16 项 benchmark 综合平均 62.92;在 AppWorld、MINDCUBE 等 Agent 任务上表现突出。配套的 StepInference NPU 推理引擎在 Hexagon NPU 上对比 llama.cpp,文本、图像、语音场景都更快,prefill 速度可达 1395 TPS。
端云分工是大方向
作者把阶跃的布局概括为 Pro + Flash + Edge 三层:Pro 负责复杂推理,Flash 负责高频低延迟云端 Agent,Edge 负责终端本地执行。文章认为,这种“云端超级大脑 + 终端执行层”的架构,正逐渐成为行业共识。
所属事件:阶跃星辰发布StepEdge端侧模型全家桶(3 条相关)→
「Infra」频道最新
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11