Qwen3.6-27B 代码工作怎么配参数
starkruzr · reddit · 2026-07-18
楼主在讨论:Qwen3.6-27B 做代码工作时,哪些 harness、服务端参数和系统提示词组合更有效。
他先给出自己在 2×16GB 显卡机器上的一组 llama-server 预设,包括不同量化、MTP、KV cache 和上下文长度的搭配,并总结了几个结论:
- q80 KV 大约能比 f16 KV 多出约 1.5× 上下文,质量损失很小。
- MTP(draft spec-decode) 能提速,但会牺牲部分上下文。
- 32GB 显存里基本只能同时放下一个 27B 模型,切换模型会有几秒重载成本。
他真正想问的是:在这些硬件约束下,大家是怎么配 harness、system prompt 和推理设置,才能让这个模型更像一个可靠的 coder。
「编程与Agent」频道最新
- Warp 六个非工程团队全用 Linear 和 Claude Code 工程化运作 — mon__lim · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11