后训练框架 Halo 宣称吞吐达 TRL 2.8 倍,遭质疑选择性跑分
_ScottCondron · x · 2026-09-23
新开源后训练框架 Halo 宣称在单 GPU SFT 场景下比 TRL 吞吐最高提升 2.8 倍、峰值内存更低,且模型保持原生 HuggingFace 格式。但 Wing Lian(Axolotl 作者)指出:在单卡 B200 上对 GLM Flash 做 SFT 时,Halo 实际比 Axolotl 还慢约 5%,因此官方只对比了 TRL,质疑其基准为选择性呈现数据。
「Infra」频道最新
- 开发者吐槽:Agent 架构被 KV cache 绑架,盼推理专用芯片 — dbreunig · 2026-09-23
- GE Vernova 燃气轮机积压订单提前至 2027 年初达 2000 亿美元 — BenBajarin · 2026-09-23
- 两篇新论文:递归语言模型域外泛化;XMerge 层剪枝深度压缩 — burny_tech · 2026-09-23
- DeepSeek 报告被赞:KV cache 小得离谱,infra 设计藏满细节 — stochasticchasm · 2026-09-23
- RTX 4090 本地跑 Qwen 27b 编程:速度超 Opus,瓶颈是显存 — julianharris · 2026-09-23
- FP8 调优砍掉 42.9ms,SGLang 自改内核推理提速 126% — HankYeomans · 2026-09-23