8 月本地 AI 大盘点:31 个新开源模型一口气看完
vramkickedin · reddit · 2026-09-01
Reddit 用户汇总 2026 年 8 月本地部署领域的模型动态,覆盖 31 个新发布:
- 大参数开源:Motif-3 开源 314B 长程 agentic 模型;Qwen3.8-2.4T-A95B 把 Qwen Max 级能力带到本地大机器;LG 的 K-EXAONE-2.0-750B-A37B 支持 262K 上下文和 10 种语言;Solar-Open2-250B 用 4-bit MoE 压到 153GB
- 稀疏/高效 MoE:Ornith-1.5-35B-A3B、NVIDIA Nemotron-3.5-Lightning-30B-A3B-NVFP4、AMD Instella-MoE-16B-A3B、美团 LongCat-Flash-Lite-Sparse(百万 token 上下文)
- 端侧/微型:LiquidAI LFM2.5-2.6B 面向手机;Supra2-100M、GPT-X2.5-135M、BetterGPT-150M 等小模型;1.98MB 的聊天标题模型 TinyTitle
- 特殊方向:DeepSeek-V4-Pro-0813 强化 agentic 工具调用;Poolside 私有编码模型 Laguna-S-2.1;丹麦 DFM-Mimir 伦理模型;Maple-Preview 以 200 tok/s 解奥赛题;Ling 3.0 系列多个量化版本;去除 AI 腔调的 Gemma-4 微调版
「Infra」频道最新
- Qwen3.8 Flash 在双 DGX 上跑出 415 tok/s — NVIDIAAI · 2026-09-01
- 曝 OpenAI 自研芯片 Jalapeno:LLM 推理速度达 1500 tokens/s — firstadopter · 2026-09-01
- TensorSharp 跑 Qwen 3.8 Flash Next 性能实测 — fuzhongkai · 2026-09-01
- 腾讯混元 AngelSlim:Hy4 模型压缩至 214GB 并支持异构协同 — 腾讯混元 · 2026-09-01
- 三星为英伟达改推8层HBM4E,速率要求提高20% — 创业邦 · 2026-09-01
- 为何 Llama.cpp 中增大上下文反而提升了推理速度? — satnl · 2026-09-01