单卡 3090 跑 27B 模型做编码 Agent,吞吐与失败案例全公开
Adorable-Cost-3249 · reddit · 2026-10-02
作者用 RTX 3090(24GB)+ llama.cpp + OpenCode 本地跑 Qwen3.8-27B Q4KM,完整公开了配置与实测结果。
性能要点
- 131K 上下文全层进 GPU,峰值显存 22.2GB;生成速度从 2K 输入的 36.4 tok/s 降到 120K 输入的 20.9 tok/s。
- 前缀缓存复用下,120K 输入的首 token 延迟可低至 0.63 秒,但全新 120K prompt 首token要 183 秒。
四个限时 8 分钟的 Python 编码任务
- LRU 缓存、CSV 账本、SQLite 转账三项通过全部独立测试(但事后复查仍发现 Decimal 舍入、并发测试实为串行等缺陷)。
- 增量构建规划器彻底失败:8192 token 输出额度全部耗在推理上,最终以 length 截断、未产出补丁;关闭思考模式后同一任务 5m40s 完成、9/10 通过——指向「输出预算不足」而非上下文不够。
可借鉴的工作流:限定任务 + 明确验收标准 + diff 审查 + 独立测试;换思考设置和输出预算多次重复再下结论。
「编程与Agent」频道最新
- Greg Mushen 的智能体首次卡壳:触发安全机制需人工代发 — gregmushen · 2026-10-02
- HumanLayer 预告新项目:打造面向 AI 时代的软件锻造厂 — zeeg · 2026-10-02
- Karpathy 分享四招理解 LLM 输出:从受控写作到定制讲解视频 — karpathy · 2026-10-02
- CSS 锚点定位实现磁吸 Bento 卡片悬停效果 — jh3yy · 2026-10-02
- Agent 为何难以越用越聪明:改进信号与错误发生在不同位置 — blaizedsouza · 2026-10-02
- pmndrs 作者发布 AI 驱动 CAD:Agent 写代码并验证出模型 — burhop · 2026-10-02