斯坦福新指标:混合本地-云路由省 60-80% 成本与能耗
rohanpaul_ai · x · 2026-09-11
斯坦福大学联合 Together AI 发布论文《Intelligence per Watt: Measuring Intelligence Efficiency of Local AI》,作者含 Christopher Ré、John Hennessy 等。核心内容:
- 提出 IPW(每瓦智能)指标:用「本地小模型对前沿模型的胜率 ÷ 单位功耗」统一衡量本地推理的能力与效率。
- 评测了 20+ 个本地 SOTA 模型(≤20B 激活参数)、8 种硬件加速器(本地与云端)、100 万条真实单轮对话与推理查询。
- 关键发现:混合本地-云路由相比批量云基线可降低 60%–80% 的能耗、算力与成本。
- 2023 到 2025 年,本地 AI 的 intelligence-per-watt 提升 5.3 倍,可本地服务的查询覆盖率从 23.2% 升至 71%+。
结论指向:随着小模型与端侧加速器(如 Apple M4 Max)进步,本地推理可切实分担云端基础设施压力。
所属事件:斯坦福论文:本地加云端混合路由可省六至八成成本(2 条相关)→
「Infra」频道最新
- 西班牙新规要求 80% 逐小时绿电匹配,数据中心建设或耗资千亿欧元 — eherrerosj · 2026-09-11
- 高通新一代 Hexagon NPU 曝光:可跑 30B MoE,上下文 32K — lee_stott · 2026-09-11
- 斯坦福论文:本地+云端混合路由可省 60%-80% 算力成本 — rohanpaul_ai · 2026-09-11
- 租 GPU 踩坑实录:vCPU 数量与脚本默认值让成本差 31 倍 — Worldly_North_7213 · 2026-09-11
- 给 NVIDIA PAIR 加 AMD ROCm 遥测,双节点集群跑通 llama.cpp 路由 — Don_Reuter · 2026-09-11
- 128GB 笔记本本地跑 Qwen3.8 做 Agent 编码,思考 token 才是耗时瓶颈 — deepu105 · 2026-09-11