TensorSharp 运行 GLM-5.2 性能反超 llama.cpp
AdhesivenessWeird770 · reddit · 2026-08-20
在 3 张 RTX PRO 6000 Blackwell 上对 GLM-5.2-UD-IQ2XXS 模型进行了测试。结果显示,在短提示词下 llama.cpp 略快,但在长上下文(2048+ tokens)处理中,TensorSharp 利用更大的微批次优化了 MoE 结构,速度显著领先(最高快 50%)。原因在于 GLM-5.2 的 256 路由专家结构在大批次下 GPU 利用率更高。
「Infra」频道最新
- 用 MiniMax H3 加 Qwen 图像编辑复刻福尔摩斯短片,3090 上 10 秒一帧 — nikhilprasanth · 2026-08-20
- 运维事故:在线 Ceph 集群重设计存储布局引切尔诺贝利玩笑 — l4rz · 2026-08-20
- MiniMax H3 视频模型成功跑在 16GB 内存 Mac 上,靠 VPIPE 方案 — TgoAI · 2026-08-20
- SpaceXAI 换地 69 英亩,斥资 4000 万美元建公共设施 — chrisgrayson · 2026-08-20
- OpenAI 接收首批 NVIDIA Vera Rubin 机柜,投入下一代模型预训练 — udayruddarraju · 2026-08-20
- Pirate Face:为开源模型构建永久性抗脆弱分发层 — mertdumenci · 2026-08-20