Qwen3.8-27B 无人监督 21 天自建 CUDA 推理引擎,实测 3090 上百 token/s
DanGrover · x · 2026-09-22
一场长程 Agent 实验:Qwen3.8-27B 在单张 RTX 3090 上花 21 天尝试自建 CUDA 推理引擎,全程几乎无监督、无人工手写 CUDA,仅约 12 次人为提示。由 DeepSeek Harness 统一编排(子 Agent、角色、交接、上下文管理与压缩),HyperQwen 通过 vLLM 提供模型服务。三周累计:180 个子 Agent、处理 2.3 亿 token、17 亿 cache-read token、699 次上下文压缩、压缩耗时 83 小时。最终引擎未能超越 llama.cpp(原帖截断处所示)。
实测者 Dan Grover 表示:在自己 3090 上该引擎可达 90-100+ tok/s(128k 上下文),已具备可用性,但默认配置关闭了视觉。
所属事件:单张 3090 跑 Qwen 27B 自主编码 21 天,交出可用 CUDA 内核(2 条相关)→
「编程与Agent」频道最新
- 开源 SemIf 无需等 Jev:4B 模型在单张 3090 上跑语义决策 — Hacubu · 2026-09-22
- 开发者分享多模型分工流:研究用 Perplexity、编码主力 Claude Code — ZabihullahAtal · 2026-09-22
- Amazon 封禁 Meta Muse 智能体,平台与 Agent 大战开启 — clarejtbirch · 2026-09-22
- Fireworks 分享 Jev 训练用法:GRPO 强化微调打分、离线筛 DPO 样本 — sophiamyang · 2026-09-22
- 打磨一年的 Agent Harness 定型:后端给模型最大自由度,前端是自由画布 — TheZachMueller · 2026-09-22
- 开发者打造 open-jev:浏览器端本地运行的 System One 判别式 AI — HowDevelop · 2026-09-22