Packed-encoders 通过去掉 padding 计算把训练提速 5 倍
antoine_chaffin · x · 2026-07-28
- 作者做了一个名为 packed-encoders 的工具集,用 CuteDSL 和 Triton 编写形状无关的内核,让模型在压缩后的序列上运行,避免把算力浪费在 padding 上。
- 官方给出的效果是:训练快 5 倍、索引快 2 倍、推理快 1.2 倍。
- 配图里的代码展示了它如何直接接管预训练模型并原地安装 fused forward,说明这是可以落地的工程实现,而不是概念讨论。
「Infra」频道最新
- 赞助 GPU 联系人开始公开,几个月前名单还是空的 — ctjlewis · 2026-07-28
- DeepInfra 上线 Claude Opus 5,支持 100 万上下文和新价格 — gharik · 2026-07-28
- Bittensor 推出面向 agent 的 MCP 入口,可路由存储推理训练 — markjeffrey · 2026-07-28
- 帖文称中国芯片至少还要十年才会被云厂商考虑 — inductionheads · 2026-07-28
- B200 微调实测最高提速 5.8 倍、显存减半 — antoine_chaffin · 2026-07-28
- Gemma 4 在 48GB Mac 上本地实测,MLX 对比 llama.cpp 和 Java 25 — rseroter · 2026-07-28