单张 5090 跑出 2.3 万 tps 解码,自训模型成本降约 90%
jon_durbin · x · 2026-10-03
开发者 jondurbin 公布其模型训练 Kappa run 的初步结果与推理代码:以约 9T tokens 训练、参数量 576B checkpoint(Gated DeltaNet-2 架构),在 ARC-C、OBBA、TQA 等基准上超过 Llama 3.2 1B,并在 ARC-E、SciQ 等上接近持平,而每 token 成本便宜约 90%。
推理侧:在 vLLM 的 Parallax fork 中,单张 RTX 5090 高 batch 下解码速度约 23k tps(fp16 GDN2 可达约 28k tps),prefill 约 70k tps(视上下文长度)。训练中发现的问题包括 GDN2 某个 head 的 per-channel decay gate 下溢。llama.cpp fork、移动端推理与训练代码将陆续开源。
所属事件:开发者以十分之一成本开源预训练追平 Llama 3.2 1B(2 条相关)→
「Infra」频道最新
- 博通拟向 Anthropic 提供最高 420 亿美元贷款供其购买算力 — VraserX · 2026-10-04
- Workato 的 AI 账单暴涨七倍:按席位授权变成按量计费 — YvesMulkers · 2026-10-04
- 开发者实测 Cloudflare D1:3% 读请求耗时 3-10 秒 — TejasKumar_ · 2026-10-04
- 谷歌首座轨道数据中心已入轨:冰箱大小、1 千瓦太阳能 — lemire · 2026-10-03
- 日本算力热催生奇葩牛股:自动售货机厂商股价年涨超 500% — PAstynome · 2026-10-03
- 开源 Strata:12GB 显存家用机跑通 1250 亿参数 Qwen 模型 — lxfater · 2026-10-03