讯飞星火X2.5全靠万卡国产910B训练,机器有效时长超97%
机器之心 · wechat · 2026-09-11
机器之心深度解析科大讯飞星火X2.5(MoE架构,293B-A30B)如何在万卡国产910B集群上完成预训练与后训练,并披露万卡国产算力的四大工程挑战与解法:
- 算得快:定向优化Attention算子,效率较基础实现提升2倍以上
- 装得下:稀疏注意力+跨层共享索引降低长上下文开销,动态负载均衡的长序列并行使长文本训练效率提升30%以上
- 传得顺:通信压缩、分层通信与计算并行,训练效率再提升10%
- 跑得稳:训前校验、训中卡死自动检测、失败任务自动重提、进程级快速恢复,机器有效训练时长超97%
模型侧通过多教师在线策略蒸馏(MOPD)整合多领域教师优势,强化代码与智能体能力。在DSA稀疏注意力算子优化案例中,星火X2.5通过约1600次工具调用,相比torchnpu实现取得3.5倍加速——模型开始反过来参与NPU底层算子优化,形成「国产算力训练模型→模型优化算子→反哺训练」的反馈循环。团队还在寒武纪MLU590、中科海光BW1000等国产芯片上开展适配。
「Infra」频道最新
- 4 块 RTX Pro 跑满精度 DeepSeek 4.1 Flash,破 300 TPS — TheZachMueller · 2026-09-11
- 网页 demo 近似复现 V4.1 flash 的 KV 快速预填充,跑在 Qwen3 上 — T_rex2700 · 2026-09-11
- OpenAI CFO:一年前买的算力如今市场价涨 3-5 倍,但仍然不够用 — rwang07 · 2026-09-11
- REVA 挖掘 LLM 历史注意力构建可复用证据视图,RAG 压缩开销降 5-15 倍 — _reachsumit · 2026-09-11
- Edge0-35B-A3B 预览版登 HF 热榜,主打边缘推理与 MoE 架构 — Edge0 · 2026-09-11
- Reflect Orbital 拟用卫星镜面「卖阳光」,首发卫星待发射 — kyliebytes · 2026-09-11