单张 3090 本地跑 Qwen 27B 量化模型,SWE-Bench 得分 87.6%
Ok_Warning2146 · reddit · 2026-09-16
一位开发者分享了在单张 RTX 3090 上用 llama.cpp 本地运行 unsloth 的 Qwen 27B IQ4NL 量化模型评测 SWE-Bench 的完整配置与结果:
- 配置要点:llama-server 开 jinja 模板、229K 上下文、KV cache 用 q80 量化、关闭 speculative decoding、附带 bf16 mmproj;采样参数 temp 1.0 / topp 0.95 / topk 20。
- 结果:500 道测试跑了 8 天,339 题解决,正确率 87.5969%——对量化模型来说相当亮眼。
- 问题:9 个 LimitExceeded、103 个 TimeoutExpired 错误导致 112 题未正常完成,作者向社区求解如何调 llama-server 参数减少超时、提升完成率与解决率,以及除 MTP 外还有哪些提速手段。
这条帖同时展示了消费级单卡跑编程 agent 评测的可行性上限与工程痛点。
「编程与Agent」频道最新
- Codex 用户额度告急:仅剩 7%,距重置 3 天,20x 档暂停无法升级 — jasonkneen · 2026-09-16
- 开源工具 Orca 同屏并行跑 5 个 Claude Code,已揽 6 万 Star — alex_verem · 2026-09-16
- claude-reflect:自动捕获纠错给 Claude Code 建永久记忆,开源爆火 — tom_doerr · 2026-09-16
- Obsidian 自动化完全指南免费发布,含 AI Agent 实战与 2 万笔记案例 — dSebastien · 2026-09-16
- DaedalMap 发布飓风 MCP 数据源,收录 1842 年至今全球热带气旋 — modelcontextprotocol · 2026-09-16
- DoorDash 推出官方 MCP Server,可创建与管理配送请求 — modelcontextprotocol · 2026-09-16