Nex N2.5 Mini 4bit 跑上 M5 Max:133.6 tok/s,质量速度兼顾
DerTomsn · reddit · 2026-09-13
Nex N2.5 Mini 本周发布,作者用 MLX 4bit 量化版在 Apple M5 Max 上实测:推荐参数 temperature 0.7、topp 0.95、topk 40、reasoningeffort high 下达到 133.6 tok/s 的生成速度,prompt 处理也很快,显存占用合理,各项质量表现不错。作者计划用它驱动自己的 agent 并尝试写代码。量化模型与完整跑分数据均已在 Hugging Face 和 llm-bench.io 公开。
「Infra」频道最新
- 从 KV 缓存本质讲透 MHA/MQA/GQA/MLA 四种注意力变体的区别 — techNmak · 2026-09-13
- 前 OpenAI 员工:「哪家实验室赢下 AGI」是个过时概念 — GregCook2011 · 2026-09-13
- 实测 Docker 跑 ComfyUI 零性能损失,但默认 /dev/shm 会触发 OOM — fluxdraw · 2026-09-13
- Qwen3.8-27B EXL3 量化版一键部署,16GB 显存就能本地跑 — udmrzn · 2026-09-13
- Positron 15 个月出货 AI 芯片,Ainek 传 13 个月更快 — DavidBennett__ · 2026-09-13
- nic_carter 用 Meta 官方图纸重制数据中心图:大,但没到半个曼哈顿 — AccBalanced · 2026-09-13