Jetson Orin 上 Gemma4 E4B 提速:fork exllamav3 prefill 达 1136 tok/s

cortexist · reddit · 2026-10-12

作者为 Jetson Orin Nano Super 8GB 优化 Gemma E4B 推理:自研引擎 little-gemma V1.0 已大幅超过 llama.cpp(decode 26.36 vs 19.49 tok/s),但仍不满足需求,于是 fork exllamav3 并移植关键代码,得到 EXL3 版本——930-token prompt 下 prefill 达 1136 tok/s(llama.cpp FA 开启为 622),首 token 延迟 878ms,decode 略降至 16.45 tok/s,但语音对话整体延迟更低。作者放出 fork 与量化权重,指出 EXL3 方案适合需要高 prefill 吞吐的场景。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →