双 RTX 3060 跑 Qwen3.8-27B:50 tok/s 部署配方
Ecstatic-Wash-7667 · reddit · 2026-08-15
Reddit 用户分享了在双 RTX 3060 12GB 上运行 Qwen3.8-27B 的 llama.cpp 配置,使用 MTP 投机解码,达到 50.6 tok/s 的生成速度,预填充 573 tok/s,VRAM 占用 23.2/24.0 GiB。
所属事件:双 RTX 3060 实测 Qwen3.8-27B 跑出 50 tok/s(2 条相关)→
「编程与Agent」频道最新
- 前 Meta 科学家:Agent 应像人一样通过像素操作网页 — DhruvBatra_ · 2026-08-15
- 集成 VLM 与 LLM 的 reBot 机械臂控制栈发布 — kamathsblog · 2026-08-15
- 开发者的 Cloud Agent 初体验:摆脱繁琐权限确认 — davidcrawshaw · 2026-08-15
- 实测3款模型为本地AI大脑安装写规格:一个引用真实文件,一个记错macOS兼容性 — schwentker · 2026-08-15
- Claude Code CLI 2.1.233 更新:新增沙箱与 GitLab 支持 — ClaudeCodeLog · 2026-08-15
- Claude Code 2.1.233 更新日志:Bash 内存隔离、按用户记账 — ClaudeCodeLog · 2026-08-15