4090 单卡跑 27B 模型:262K 上下文 + 130 tok/s
Distinct-Pie2389 · reddit · 2026-10-09
作者在单张 RTX 4090 上用自研推理引擎 NInfer(C++/CUDA)运行 HauhauCS 的无审查版 Qwen 27B 模型(GGUF 格式发布,需自行转换格式),取得以下成绩:
- 262K 上下文(模型原生满窗口)
- 解码约 130 tok/s(使用 MTP3 投机解码,接受率 70.8%),此前 llama.cpp 在 131K 上下文下仅 91.6 tok/s
- 9K prompt 上 prefill 达 3591 tok/s
- Perplexity 与官方权重差距在 1.3% 以内,说明转换无损
- 视觉与 tool calls 功能保留
转换器与详细说明已在 GitHub PR 和 ninfer-4090 仓库开源。
「Infra」频道最新
- 64GB 内存也不够用了:本地 AI 正在掏空 Mac 内存余量 — gregmushen · 2026-10-09
- 20 秒起 250 台 VM 跑 Agent 沙箱,成本仅 10 美分 — RexDouglass · 2026-10-09
- 缓存命中≠免费:拆解 Triton 编译缓存的双生命周期与隐性成本 — Mahmoud_Zalt · 2026-10-09
- AI 智能体将催生史上最大官僚系统:机器为机器打工 — brucemacv · 2026-10-09
- Bittensor 上的 GPU 云 Lium 半年回购销毁近 270 万美元 SN51 代币 — markjeffrey · 2026-10-09
- 谷歌开源ML Drift:一套代码搞定四大GPU后端,YouTube Shorts帧延迟降40% — lmoroney · 2026-10-09