老旧 i5+3070 跑 156 次测试:功率限制下的本地模型能效账
bulletrhli · reddit · 2026-09-27
一位数据工程师在 Lenovo M920Q(i5-8500T、16GB 内存)外接 OcuLink 的 RTX 3070 8GB 上,用 Proxmox LXC + Ollama + OpenWebUI 做了一轮功耗实测:4 个模型 × 6 档功率限制(100-220W)× 3 次共 156 轮测试,记录 tokens/s、时长与自创的 tokens/s/W 指标。
关键发现:
- gemma4:e4b 表现最佳:不过度思考、语气与简洁度可控,还能塞下约 16k 上下文,是日常首选
- qwen3.5 输出质量好但是重度思考型,功耗一度冲到 203W
- qwen3-vl 同样是思考型,thinking 膨胀上下文,常早早知道答案却陷入思维循环;作者倾向弃用推理视觉模型回归传统 OCR
- deepseek-coder-v2 凭 MoE 架构在 40/60 CPU/GPU 分配下仍很流畅
结论:低瓦数下功率限制即上限,对本地部署玩家选模型和调功耗有直接参考价值。
「Infra」频道最新
- OpenAI 申请「Serrano」商标,覆盖 AI 芯片与数据中心硬件 — imjustnewatai · 2026-09-27
- NVIDIA B300 指数上线:$6.95/GPU时,四月以来租金涨 43.9% — AccBalanced · 2026-09-27
- ENGRAM 内存架构或重塑数据中心 DRAM/HBM 配比,省下数十亿美元 — AccBalanced · 2026-09-27
- SpaceX 太空算力 2028-30 年比地面贵 15-30%,但几乎零 Opex — JOBhakdi · 2026-09-27
- 半导体风险不止于芯片业:AI 与云的依赖常被低估 — rvp · 2026-09-27
- DGX Spark 手册发布:本地推理入手这块"金色砖头"前必读 — lifebypixels · 2026-09-27