CoreWeave 无服务器推理上线 Nemotron 3.5 Lightning
wandb · x · 2026-08-12
CoreWeave 宣布其无服务器推理平台已正式上线 NVIDIA Nemotron 3.5 Lightning 模型。该模型是从 Nemotron 3 Ultra 蒸馏而来的定制版 30B MoE 模型(3B 活跃参数),专为常驻型智能体设计。
官方强调,这是同类开源模型中运行速度最快的,非常适合处理编码、工具调用、多轮智能体工作流等高吞吐任务,且开发者无需管理底层基础设施即可直接调用。
「Infra」频道最新
- Ling-3.0-flash 量化实测:MoE 架构让解码速度几乎无损 — AcanthisittaOk1699 · 2026-08-12
- NVIDIA 路由库实测:编码智能体成本降 59%、耗时减 32% — sudoraohacker · 2026-08-12
- SD视频生成优化实测:CK加速使耗时大降,但提示词遵循变差 — switch2stock · 2026-08-12
- M4 Max 浏览器跑 30B 模型达 25 tok/s,自定义 WebGPU 内核立功 — xenovatech · 2026-08-12
- 开发者询问OpenAI:能否用自家地下室GPU运行ML实验? — daniel_mac8 · 2026-08-12
- LMSYS发布统一Radix缓存:混合模型前缀缓存新方案 — ying11231 · 2026-08-12