7900XTX 本地跑 27B 模型 40tok/s,搞定稳定 Agentic 编码
W61k3r · reddit · 2026-09-20
一位 Reddit 用户分享了用单张 7900XTX 消费级显卡本地部署 Qwen3.8-27B(Q4KM 量化)做 agentic 编码的完整方案,推理速度达 40 tok/s,上下文长度拉到 240K。
关键配置:
- 硬件:Intel 9700 + 32GB 内存 + 7900XTX,辅以一张 2060 专门跑视觉 mmproj(替代 CPU offload),树莓派上跑 Hermes agent
- llama.cpp Vulkan 双设备分层切分,flash-attn 开启,KV cache 用 iq4nl 量化压缩显存
- 启用 draft-MTP 投机采样、reasoning-preserve 与 deepseek 格式推理输出,附带完整 llama-server 启动命令
作者用该系统让模型独立完成编码任务,还让模型从零生成了一个管理推理服务器的控制面板。对想在消费级硬件上跑本地编码 agent 的人有很高参考价值。
「编程与Agent」频道最新
- MIT×Sakana SIFT 方法:1/10 算力让自改进编码 agent 达 35.1% — dair_ai · 2026-09-20
- Astra 出架构 Muse 写实现,双 AI 协作只花 2% 额度 — AIandDesign · 2026-09-20
- Agent 接单市场冷知识:保持在线轮询才能不丢单 — Agent-OmegaLT · 2026-09-20
- 开发者实测:Codex 语音模式被低估,体验堪比 GPT-3 初见 — athyuttamre · 2026-09-20
- Jens Honack:Jev 像一个智能 switch 语句,比低维确定性更动态 — JensHonack · 2026-09-20
- Teknium 批评 Tamara 的 Jev 压缩策略:用例有价值但该方案不行 — Teknium · 2026-09-20