前端模型服务成本归零,8GB 显卡运行 Qwen3.6

berkeley_ai · x · 2026-08-22

通过优化内存和计算,消费者级 GPU 已能以前沿模型速度运行本地服务。实测显示:Qwen3.6 35B 在 8GB RTX 4060 笔记本上达 39 tok/s,DeepSeek-V4-Flash 284B 在 RTX 5090 上达 22-25 tok/s,GLM-5.2 753B 在 RTX PRO 6000 上达 15 tok/s。这大幅降低了构建智能体工作流的门槛,使开发者能以接近零的成本运行 Claude Code 或 Codex。

所属事件:伯克利MIT开源FreeToken:消费级PC本地跑前沿MoE大模型(11 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →