2.6B 竟胜 2B:LFM2.5 速度更快、内存省 1.3GB 实测对比 MiniCPM5
parepeg · reddit · 2026-10-05
一位 Reddit 用户在 M1 Air 上实测两款小型模型处理带工具调用的 agentic 任务(如查天气)。
结论:LFM2.5 2.6B 明显占优
- 速度:预填充 200 t/s、生成 22 t/s,优于 MiniCPM5 的 162/16 t/s
- 内存:32k 上下文下仅约 2.5GB,MiniCPM5 反而要 3.8GB(即便参数更少)
- 短对话一次性任务表现好,但对话变长后幻觉明显增多
MiniCPM5 2B
- 配套 DSpank 草稿模型可用 speculative decoding 加速
- 英文对话时常混出中文回复,但用英文回答时表现聪明,agentic 能力可能更强
作者附上了两条完整的 llama-server 启动命令(含量化缓存、草稿模型等参数),可在本地复现这套端侧小模型 agent 部署方案。
「Infra」频道最新
- 一条 USB-C 线把 iPhone 变 24GB MacBook 副显卡,跑 Qwen 27B 快 40% — TheMoonMidas · 2026-10-05
- Hugging Face Accelerate 前负责人亮履历,回应本地 AI 质疑 — TheZachMueller · 2026-10-05
- 算力交易员亲历:买方只认 NVIDIA,CUDA 护城河依然稳固 — sudoraohacker · 2026-10-05
- 美光 CEO:2027-2028 年内存供应将比 2026 年更紧张 — chillinewman · 2026-10-05
- 独立开发者省钱组合:Firebase+Cloudflare R2+Vercel 最便宜 — jdluk87 · 2026-10-05
- 16GB 显存跑 35B MoE:fork llama.cpp 实现 experts 扩容提速至 60 tok/s — Specific-Tax-6700 · 2026-10-05