Ling-3.0-tiny 在 8GB 设备上跑通 128K 上下文
Puzzleheaded_Base302 · reddit · 2026-08-19
实测展示 inclusionAI 的 Ling-3.0-tiny 模型在售价 $249 的 NVIDIA Jetson Orin Nano Super (8GB RAM) 上运行。使用 IQ4NL 量化 (4.5 bpw),成功跑满 131,072 token 的原生上下文,解码速度约 33 tok/s,显存占用 7.4GB。技术细节包括使用 llama.cpp master 分支(支持 BailingMoE V3 架构)、具体的编译命令及性能基准表。
「Infra」频道最新
- M3 Max 上 4-bit 量化跑 Qwen 3.8:每秒 25 token 已完全可用 — AIandDesign · 2026-08-19
- 海光半年净利18亿,LG与英伟达推人形机器人 — 创业邦 · 2026-08-19
- 打造真正离线 AI:认知循环与本地化实践 — HotEstablishment7184 · 2026-08-19
- OpenAI 训练中约 20% 算力用于推理 — eliebakouch · 2026-08-19
- Vercel KMS发布:在函数中安全签名JWT,私钥永不暴露 — cramforce · 2026-08-19
- Apple 基础模型框架实测:基于动态配置文件的混合路由 — Scobleizer · 2026-08-19