单张 4090 跑 Qwen 27B 三天长会话,输出卡死在无尽斜杠
Tiny-Entertainer-346 · reddit · 2026-09-23
作者用 llama-swap(底层 llama-server)在单张 RTX 4090 + 32GB 内存上跑 Qwen3.8-27B 的 UD Q4KXL 量化版,搭配 VS Code GitHub Copilot 做编码。一个会话未重置连续用了三天,导出文本超 2 万行(不含图片序列与思考 token),CTK/CTV 用 Q8、上下文 131072。日常预填充速度约 2200-2800 tok/s,生成约 23 t/s,Copilot 会自动压缩会话。但现在 llama-server 输出正常计速,聊天界面却返回永无止境的「//////」,作者求助原因。
「Infra」频道最新
- Cloudflare CTO 入选 TIME 年度高管:为 agent 时代重建互联网 — dinasaur_404 · 2026-09-23
- Rat Stack:把应用和云写成一个类型化程序,让 AI agent 可靠地搭建部署 — samgoodwin89 · 2026-09-23
- optimAIzr:本地 CLI 找出 AI 用量浪费,支持 Claude Code 与 Codex 省钱 — stichstichstich · 2026-09-23
- 256GB 内存版 Mac Studio 二手溢价 6000 美元仍一机难求 — GabGarrett · 2026-09-23
- Ben Bajarin 解析 AI 数据中心:CPU 与内存如何限制 GPU 推理服务能力 — BenBajarin · 2026-09-23
- Epoch AI 报告:「思考」的价格正在暴跌,智能成本持续陡降 — Proper_Actuary2907 · 2026-09-23