RTX 4090 本地跑 Qwen 27b 编程:速度超 Opus,瓶颈是显存
julianharris · x · 2026-09-23
作者分享在 RTX 4090 24GB 上本地运行 Qwen 27b 做编程的一手体验:
- 能力足够:远超 2025 年 11 月之前所有编程模型,本地速度常达 Opus 的两倍。
- 多会话切换:切换会话会触发大量缓存刷新,且一次只能一个;Qwen 4 的缓存结构更乱、更难共享。
- 图像处理:提交图片占用大量内存。
- 速度衰减:dense 模型上下文每翻倍(16-32-64-128k)速度减半,Flash next / Qwen 4 更好。
- 会话恢复:本地恢复或切换会话可能要等一两分钟。
结论:最大瓶颈是显存,而现在正是显存昂贵的糟糕时期,只能先用着。
「编程与Agent」频道最新
- 开源 MCP 服务器实现在 IDE 内管理 GitHub Gist — modelcontextprotocol · 2026-09-23
- Stripe 推出 WebMCP,Agent 完成支付省 42% token — jeff_weinstein · 2026-09-23
- Swarms 市场支持从私有 GitHub 仓库导入并上架售卖智能体 — KyeGomezB · 2026-09-23
- 让 Opus 5 写交接提示词,再用 Opus 5.5 杀掉旧 worker — doodlestein · 2026-09-23
- AssemblyAI HTTP tools 实战:免 WebSocket 部署可预约语音 Agent — AssemblyAI · 2026-09-23
- 与 Opus 5.5 对话一小时,做出 WebGPU 3D 落地页 — kevinkern · 2026-09-23