单张 5090 跑出 2.3 万 tps 解码,自训模型成本降约 90%

jon_durbin · x · 2026-10-03

开发者 jondurbin 公布其模型训练 Kappa run 的初步结果与推理代码:以约 9T tokens 训练、参数量 576B checkpoint(Gated DeltaNet-2 架构),在 ARC-C、OBBA、TQA 等基准上超过 Llama 3.2 1B,并在 ARC-E、SciQ 等上接近持平,而每 token 成本便宜约 90%。

推理侧:在 vLLM 的 Parallax fork 中,单张 RTX 5090 高 batch 下解码速度约 23k tps(fp16 GDN2 可达约 28k tps),prefill 约 70k tps(视上下文长度)。训练中发现的问题包括 GDN2 某个 head 的 per-channel decay gate 下溢。llama.cpp fork、移动端推理与训练代码将陆续开源。

所属事件:开发者以十分之一成本开源预训练追平 Llama 3.2 1B(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →