LoRA训练实测 大Batch比梯度累积快17%
有开发者在单张T4显卡上用Qwen3-1.7B和TRL进行LoRA微调实验,对比相同有效批次大小下不同梯度累积配置(1×4、2×2、4×1)的实际耗时。结果显示梯度累积并非时间零和游戏:各配置训练时间差异显著,其中Batch Size 4直接训练比依赖梯度累积快约17%,为资源受限环境下的微调实践提供了参考。
2026-08-18 ~ 2026-08-19 · 2 条相关
- LoRA 训练实测:大 Batch 比 Gradient Accumulation 快 17% — traceml-ai · 2026-08-18
- LoRA 训练实测:梯度累积并非时间零和游戏 — traceml-ai · 2026-08-19