本地跑 Qwen3.8-Flash-Next 编程实测:5090 上 11 分钟跑赢 Claude Code
dh7net · reddit · 2026-10-11
Reddit 用户在单张 RTX 5090(64GB 内存)上用 Strata 服务 IQ3S 量化版 Qwen3.8-Flash-Next,配 pi 编码 agent 跑 airbench 日常任务测试套件,11 分钟拿下 100% 满分,同样得满分的 Claude Code 用了 14 分钟。
可复现配置要点:
- 硬件:≥24GB 显存 GPU、约 64GB 内存、90GB 磁盘;内存是瓶颈,IQ3S 量化约 50GB 专家参数留在内存,Strata 估算 256k 上下文需约 78GB。
- 模型服务:Strata 首次启动下载约 84GB 模型,Docker 构建(5090 用 CUDAARCHITECTURES=120),以 --expert-cache auto --prefill auto --spec 4 --kv int8 --vision 等参数启动,暴露 OpenAI 兼容 API 于 127.0.0.1:9000。
- pi agent:models. 配置本地 provider,settings. 将输出上限设 32k、compaction reserve 设 64k(默认 16k 时单张图片结果就可能撑爆上下文窗口)。
- 作者还写了个代理脚本,在剩余空间≥8k 时压缩输出请求、改写溢出错误让 pi 自动 compaction。
- 同配置下其他 harness 对比:omp 18.4.2 得 48/49,用时 16 分钟。
附完整命令与配置文件,想本地跑开源模型做编码 agent 的可直接照抄。
「编程与Agent」频道最新
- 用 Claude 搭二手购车监控:建模市场+浏览器抓取+每日提醒 — eherrerosj · 2026-10-11
- AI agent 调优 Triton kernel,翻转 grid 顺序换来 1.29x 推理提速 — zmkzmkz · 2026-10-11
- OpenAI Decisions API 公测,可经苹果基础模型框架调用 — rxwei · 2026-10-11
- Codex 与 Claude Code 配额重置机制经济学:何时按下最划算 — juntao · 2026-10-11
- Codex 里的 Astra 自己开浏览器查连接器参数再建模组装 — burhop · 2026-10-11
- 重度用户拆解 Codex 新用量规则:$500 档跑 Astra 不值 — DulyDully · 2026-10-11