双 3090 跑 Qwen3.8-27B 本地编码,50-65 tok/s 是否正常?
sugarfreecaffeine · reddit · 2026-08-20
Reddit 用户分享双 RTX 3090(48GB 显存)在 Windows 10 上用 llama.cpp 本地运行 Qwen3.8-27B(unsloth 动态 Q6KXL 量化),用于本地 agentic coding。生成速度约 50-65 tokens/秒,偶降至 40 多,询问是否正常。帖子附完整 llama-server 启动命令,包含 262K 上下文、q80 KV cache、flash attention、MTP 投机解码等关键参数,可供本地部署用户参考对照。
「编程与Agent」频道最新
- 上下文窗口预算速查表:让每个 Token 物有所值 — blaizedsouza · 2026-08-20
- AI 不该只是记忆,而应是可组织检索的图书馆 — dfinke · 2026-08-20
- LLM 只是 Coding Agent 一部分,核心是外部 Harness — blaizedsouza · 2026-08-20
- 智利航空利用生产反馈将 Agent 误判率降至 1% — LangChain · 2026-08-20
- 实测 Grok Bot:看一次操作即学会,自动处理报销与工单 — eyishazyer · 2026-08-20
- 苹果开发者账号配合 Codex 可快速打包 App 自用 — vista8 · 2026-08-20