Ling-3.0-tiny 在 8GB 设备上跑通 128K 上下文

Puzzleheaded_Base302 · reddit · 2026-08-19

实测展示 inclusionAI 的 Ling-3.0-tiny 模型在售价 $249 的 NVIDIA Jetson Orin Nano Super (8GB RAM) 上运行。使用 IQ4NL 量化 (4.5 bpw),成功跑满 131,072 token 的原生上下文,解码速度约 33 tok/s,显存占用 7.4GB。技术细节包括使用 llama.cpp master 分支(支持 BailingMoE V3 架构)、具体的编译命令及性能基准表。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →