双3090上调Qwen3 27B编码Agent:单轮等待从28秒降到7秒
bolts98 · reddit · 2026-09-19
Reddit 用户分享在 2×RTX 3090 上用 vLLM 跑 Qwen3 27B + Oh My Pi (OMP) 做编码 agent 的调优经验,单轮平均等待时间从 28 秒降到 7 秒。关键改动:
- 每个角色显式设置 effort level(未设置的默认为 xhigh,拖慢速度)
- thinkingtokenbudget 设为 7500
- maxTokens 从 8k 提到 32k(此前文件写入常被截断)
- 超过 10KB 的工具输出转存文件
- 子 agent 上限 4 个,开启 appendOnlyContext
「编程与Agent」频道最新
- Meta 携手 Stripe 接入 Muse 平台,Agent 支付落地商业应用 — aronchick · 2026-09-19
- Muse 接入 Plaid 自动记账,Robinhood 流水直写预算表 — alexandr_wang · 2026-09-19
- 开源引擎 Inco Splash 让 Qwen3.8-27B 在 M5 Max 跑出 144 tok/s — ResearchCrafty1804 · 2026-09-19
- Jev 准确率超越 Sonnet 5 检索方案,成本与延迟仅零头 — IanArawjo · 2026-09-19
- Jev 类 System 1 模型在实时语音 Agent 中的 9 个用法 — TheMoonMidas · 2026-09-19
- Grok Bots 支持 Webhooks,可在任意平台远程触发 — mattyp · 2026-09-19