中国电信开源星辰 Xing4.0-29B:首批全程昇腾 NPU 训练的 MoE 模型
Skyline34rGt · reddit · 2026-09-17
中国电信 AI 公司在 Hugging Face 开源了星辰系列(前身 TeleChat)新模型 Xing4.0-29B-A4B,一个 29B 总参数、每 token 仅激活 4B 的 MoE 模型。
核心亮点
- 架构:mHC + MLA + MTP,原生支持 256K 上下文(可扩展到 512K),64 个路由专家 + 1 个共享专家,面向多步规划、工具调用与复杂推理链的 Agent 场景设计。
- 全国产训练:号称是同规模中首个完全基于昇腾 910C 集群 + MindSpore 框架训练的模型,通过 MoE 通信优化、选择性重计算、DVM 自动图算融合、Ascend C 融合算子等手段,训练吞吐较开箱性能提升约 96%。
- 生态兼容:支持 LLaMA-Factory/MindFormers 微调,SGLang/vLLM/KTransformers 推理,并适配 OpenCode、Claude Code 等 agent 框架。
- 跑分:SWE-bench Verified 75.0、Terminal-Bench 2.1 57.5(优于对比的 Gemma4-26B-A4B),AIME2026 90.0,整体接近 Qwen3.6-35B-A3B 水平。
「Infra」频道最新
- 本地推理慢?推测解码用小模型起草、大模型批量验证 — HowDevelop · 2026-09-17
- 印度拟投约 300 亿美元建设本土半导体产业 — Polymarket · 2026-09-17
- 受 AgentConf 演讲启发,开发者计划在家用 Blackwell GPU 本地跑 Agent — TejasKumar_ · 2026-09-17
- 深度解析 DeepSeek-V4.1 Flash:把 KV Cache 压缩推到极限 — teortaxesTex · 2026-09-17
- 四项调度技术压平 MoE 长上下文训练内存峰值,1M 上下文吞吐提升 10 倍 — Shrey Pandit · 2026-09-17
- 两周上线:GLM 智能体自建推理基建,端到端吞吐提升 3.2 倍 — jietang · 2026-09-17