面向 8GB 级设备的开源小模型榜单:SmolLM2-135M 达 165 tok/s、29.6 tok/J
East-Muffin-6472 · reddit · 2026-09-16
作者发布了 smolperfbenchmark,一个专门面向小型开源模型的本地性能榜单,补足主流榜单默认服务器级 GPU 的空白:所有模型用同一批 GGUF 文件、统一 llama.cpp vs Ollama 对比、锁定功耗模式并记录发热。
首个实测数据点:在 8GB Jetson Orin Nano Super 上,SmolLM2-135M 跑出约 165 tok/s、25W 下 29.6 tok/J。
目前状态:
- 已覆盖 13 个模型家族,Jetson Nano Orin Super 8GB 上约 1000 个配置
- 一台设备在线实时测量 tok/s、tok/J、ITL、延迟、功耗、温度与电池
- 目标硬件包括平板、手机、Mac、Jetson、树莓派;Pi、手机和 Mac mini 数据仍在补充中
全部测试数据将公开,供用户按自己的硬件挑选合适的模型。作者附了网站文章与 Reddit 帖链接,欢迎反馈。
「Infra」频道最新
- OpenAI 高管齐表态:安全对齐也要靠堆算力,需求只会更旺 — GavinSBaker · 2026-09-16
- 百度智能云提「产业智能体」:80%央企在用,办公只是第一步 — 智东西 · 2026-09-16
- 华为坤灵一口气发20款新品,小灵智能体把1小时组网缩到5分钟 — 智东西 · 2026-09-16
- Ministral 3 3B 纯 CPU 跑在 Galaxy S21 上,10 次全成跨双浏览器转发对话 — Mean-Standard7390 · 2026-09-16
- 本地跑 Qwen 35B:32GB Mac 提示词处理慢至 20 分钟求升级方案 — Guilty-Support-584 · 2026-09-16
- llama.cpp 合入 hc 算子优化 Qwen4exp,可重新跑分 — jacek2023 · 2026-09-16