斯坦福论文:本地+云端混合路由可省 60%-80% 算力成本
rohanpaul_ai · x · 2026-09-11
斯坦福大学与 Together AI 发布论文《Intelligence per Watt: Measuring Intelligence Efficiency of Local AI》,系统度量本地 AI 的智能能效:
- 混合路由收益显著:本地-云端混合路由相比纯云端批处理基线,能耗、算力与成本降低 60%-80%。
- 能效快速提升:2023 到 2025 年,本地 AI 的 intelligence-per-watt 提升 5.3 倍,可本地处理的查询覆盖率从 23.2% 升至 71.3%。
- 手机效率惊人:同一模型同一精度下,iPhone 16 Pro 的能效约为工作站 GPU 的 7 倍。
- 模型多样性有价值:20+ 个本地模型按查询择优路由后,在 4 个 benchmark 中的 3 个上胜过 3 个前沿云模型。
- 量化精度的取舍:FP16 降到 FP4 可省 3-3.5 倍推理能耗,每降一级精度约损失 2.5 个百分点准确率;某些情况下更大的 FP4 模型可胜过更小的 FP16 模型。
- 短板在难题:最难推理切片上约 95% 的问题本地模型仍无法解决。
所属事件:斯坦福论文:本地加云端混合路由可省六至八成成本(2 条相关)→
「Infra」频道最新
- 高通新一代 Hexagon NPU 曝光:可跑 30B MoE,上下文 32K — lee_stott · 2026-09-11
- 租 GPU 踩坑实录:vCPU 数量与脚本默认值让成本差 31 倍 — Worldly_North_7213 · 2026-09-11
- 给 NVIDIA PAIR 加 AMD ROCm 遥测,双节点集群跑通 llama.cpp 路由 — Don_Reuter · 2026-09-11
- 128GB 笔记本本地跑 Qwen3.8 做 Agent 编码,思考 token 才是耗时瓶颈 — deepu105 · 2026-09-11
- AI 数据中心缺燃气轮机,SpaceX 自造稀缺部件或倒逼扩产 — rohanpaul_ai · 2026-09-11
- 从AGI任务时长定义到晶圆厂该不该自训模型的一线观察 — jwt0625 · 2026-09-11