双 3090 跑 Qwen 3.8 27B:524k 上下文,60-88 tok/s
elsung · reddit · 2026-09-05
Reddit 用户 elsung 分享在双 RTX 3090 上本地运行 Qwen 3.8 27B(HuiHui abliterated 版本)的实测配置:c=1 下实现 524k token 上下文,速度约 60-88 tok/s,并声称保持不错准确率、配合 Chain-of-Draft(CoD)减少过度思考。作者修正了此前帖子的错误(曾与 Qwen 3.8 Flash Next 混淆),并开源了完整基准配置仓库供复现。
「Infra」频道最新
- SGLang 深度解析 Breakable CUDA Graph:预填充图构建快 3.8–5.2 倍 — hsu_byron · 2026-09-05
- e/acc 领袖 Beff Jezos:恶魔岛监狱是建 AI 数据中心的绝佳选址 — beffjezos · 2026-09-05
- Jason 拿《The New Kingmakers》佐证:免费 token 正重塑算力格局 — AccBalanced · 2026-09-05
- GPU 并行沙箱:递归自我改进的算力原语 — AAAzzam · 2026-09-05
- SemiAnalysis 联手 vLLM 推出 AgentX 基准,直测多轮长上下文 Agent 流量 — AccBalanced · 2026-09-05
- Zilliz CTO 解读 Notion 向量基建两年史:成本峰值后降 90% — J_Luan_ · 2026-09-05