Jetson Orin 上 Gemma4 E4B 提速:fork exllamav3 prefill 达 1136 tok/s
cortexist · reddit · 2026-10-12
作者为 Jetson Orin Nano Super 8GB 优化 Gemma E4B 推理:自研引擎 little-gemma V1.0 已大幅超过 llama.cpp(decode 26.36 vs 19.49 tok/s),但仍不满足需求,于是 fork exllamav3 并移植关键代码,得到 EXL3 版本——930-token prompt 下 prefill 达 1136 tok/s(llama.cpp FA 开启为 622),首 token 延迟 878ms,decode 略降至 16.45 tok/s,但语音对话整体延迟更低。作者放出 fork 与量化权重,指出 EXL3 方案适合需要高 prefill 吞吐的场景。
「Infra」频道最新
- Ed Zitron 算账:AI 公司年营收需约 4250 亿美元才能填平超大规模资本开支 — SumitGup · 2026-10-12
- mitsuhiko:Agent 沙盒没有银弹,VM、沙箱、JS 解释器各有适用场景 — mitsuhiko · 2026-10-12
- River AI 上线 Rust 自研推理栈,DeepSeek/GLM Flash 定价低官方 20% — ibab · 2026-10-12
- 中科寒武纪系发布「真武V900」称中国最强AI芯片,拟训10万亿参数模型 — pstAsiatech · 2026-10-12
- Qwen3.8-27B 量化实测:MXFP4 数学反超 Q6,K/L 版代码最强但最慢 — JurBank · 2026-10-12
- 中国国资加码华虹:注册资本增至 197 亿元押注成熟制程 — pstAsiatech · 2026-10-12