前端模型服务成本归零,8GB 显卡运行 Qwen3.6
berkeley_ai · x · 2026-08-22
通过优化内存和计算,消费者级 GPU 已能以前沿模型速度运行本地服务。实测显示:Qwen3.6 35B 在 8GB RTX 4060 笔记本上达 39 tok/s,DeepSeek-V4-Flash 284B 在 RTX 5090 上达 22-25 tok/s,GLM-5.2 753B 在 RTX PRO 6000 上达 15 tok/s。这大幅降低了构建智能体工作流的门槛,使开发者能以接近零的成本运行 Claude Code 或 Codex。
所属事件:伯克利MIT开源FreeToken:消费级PC本地跑前沿MoE大模型(11 条相关)→
「Infra」频道最新
- 优化被动 Oculink 设置意外实现 CUDA 调度器 — TinFoilHat_69 · 2026-08-29
- RX 9070 XT 运行 ComfyUI 速度波动巨大 — bosox62 · 2026-08-29
- 开源 LLM 推理静态性能模型,支持多种缓存策略 — stanfordnlp · 2026-08-29
- 预测闭源前沿模型 2027 前变下载版,英伟达豪赌开源 — imjustnewatai · 2026-08-29
- 实测 Qwen3.8 在双节点 DGX 上达 181 tok/s 吞吐 — StartupTim · 2026-08-29
- Together 平台 24 小时处理 GLM-5.3 Flash 超 1350 亿 token — togethercompute · 2026-08-29