一张 3090 跑 Qwen 27B 自主编码 3 周:交出可用 CUDA 内核
skeole · reddit · 2026-09-21
Reddit 用户 skeole 用单张 RTX 3090 本地跑 Qwen 27B(Q4 量化),让 agent 循环自主运行约 21 天,任务是「为自己这张 GPU 架构写一个 CUDA 推理引擎」。关键细节:
- 设置:27B 量化模型 + 200k 上下文 + deepseek 式 harness,写了明确的 rulebook(角色分工、何时上报、不许照抄 llama.cpp、不许单方面宣布任务不可能);作者本人不会写 CUDA。
- 成果:拿到可工作的 CUDA 内核和 benchmark,但 prefill 约 250 tps,仅为 llama.cpp(700)的一半——赢了过程,没赢性能。
- 自杀循环问题:同一张卡既要跑 agent(vLLM)又要跑被测引擎,规则要求固定交接脚本(stop vLLM → bench → 重启 → 健康检查);一个 subworker 无视脚本擅杀 vLLM,把「运行自己大脑的进程」搞挂了两次。
- 本地代价:180 个 subagent、约 2.3 亿 tokens、699 次 compaction 共吃掉约 83 小时(约 17% 日历时间)。
结论:量化 27B 在消费级单卡上持续数周保持连贯目标跟踪、留下可用内核与完整 git 历史,协议设计比模型能力更关键。15GB 运行数据 + 规则集已开源于 HuggingFace。
「编程与Agent」频道最新
- TypeSafe Jev 实测:让 Grok Build 同任务成本降 22-40% — Daniel_Farinax · 2026-09-21
- jev-skill-suggester:用前置技能路由解决 Agent 调错工具问题 — udmrzn · 2026-09-21
- OpenClaw 推出 FaceTime 插件:你的 agent 能主动打电话给你 — steipete · 2026-09-21
- 花 3 天逆向 Instinct 记忆机制:极简设计,60 行代码可复刻 — julianweisser · 2026-09-21
- 实测 3 周日志:40% 编码 Agent 输入是无效开销 — Lucky-Group9525 · 2026-09-21
- Humanizer Academic 更新:一个文件去掉医学论文的 AI 味 — udmrzn · 2026-09-21