Ling-3.0-flash 开源:127B 参数 MoE 架构,官方 FP8 仅需 128GB
derspenti · reddit · 2026-08-04
inclusionAI 的 Ling-3.0-flash 模型权重已在 Hugging Face 公开,采用 MIT 协议。
- 架构与参数:总参数量 127.5B,激活参数 5.1B。采用 BailingMoeV3 架构,包含 512 个专家(每 token 激活 8 个),颗粒度比大多数同类模型更细。
- 思维链控制:思考模式(Thinking)可通过 chat template 按需开启,默认开启,无需单独的模型 SKU。
- 本地部署:BF16 版本约 255GB;官方 FP8 版本约 128GB,适合大内存主机或多卡环境直接下载使用。社区正在讨论 llama.cpp 对该架构的兼容性。
所属事件:Ling-3.0-flash混合架构MoE模型开源(2 条相关)→
「Infra」频道最新
- Wan2GP 发布:6GB 显存即可运行 Wan 2.2 等视频大模型 — cocktailpeanut · 2026-08-05
- 英伟达加入美国NSF区域AI中心,扩展全美算力与研究资源 — nordicinst · 2026-08-05
- 迈向万安培 AI 芯片:垂直供电技术成算力基建关键 — jwt0625 · 2026-08-05
- 智能体 RL 训练受限于推理:SkyPilot 实现近 50% 提速 — skypilot_org · 2026-08-05
- 硬件架构探讨:为何选择垂直供电而非垂直光互连? — jwt0625 · 2026-08-04
- CoreWeave官宣2026大会:李飞飞等大咖齐聚探讨生产级AI — wandb · 2026-08-04