LoRA 训练实测:梯度累积并非时间零和游戏

traceml-ai · reddit · 2026-08-19

作者在 Qwen3-1.7B 上使用 TRL 和 LoRA 进行实验,发现即使有效批次大小相同,不同的梯度累积策略(1×4, 2×2, 4×1)训练时间差异显著。

实验数据:

原因分析:

结论:应将有效批次(用于优化行为)和物理批次(用于显存与速度)作为两个独立选择。建议从显存允许的最大物理批次开始测试。

所属事件:LoRA训练实测 大Batch比梯度累积快17%(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →