算力紧缺时的微调策略:动态选择、混合与加权
Puzzleheaded_Box2842 · reddit · 2026-08-11
当微调预算有限时,核心问题在于如何让每次参数更新都把钱花在刀刃上。作者总结了三种动态数据策略:
- 动态选择:针对超大规模数据集。训练器定期评估哪些样本值得投入下一轮算力(基于 loss、梯度或随机规则),非常适合处理充满噪声的 SFT 指令数据。
- 动态混合:针对多领域数据合并训练。放弃固定的数据源比例猜测,动态调整不同源(如 wiki、代码、数学等)在 batch 中的占比,适用于持续预训练和领域适应。
- 动态加权:不丢弃任何样本,但在反向传播前为不同样本的 loss 赋予不同权重,以柔和地强调高价值数据、降低弱样本影响。
作者在 OpenDCAI/DataFlex 项目中实现了这一设计思路,可作为插件接入 LLaMA-Factory 训练框架。
「研究」频道最新
- 单机合并解谜游戏中的强化学习与长程规划策略探讨 — CaiwenGong · 2026-08-11
- 投票机制在智能体 RL 中充当序列级奖励信号 — burny_tech · 2026-08-11
- kohya 发布 MiniMax H3 图像训练与推理支持路线图 — bdsqlsz · 2026-08-11
- 单步生成新突破:Beckmann传输模型简化扩散推理 — kastnerkyle · 2026-08-11
- Turing Post 本周必读 AI 论文盘点 — TheTuringPost · 2026-08-11
- 新论文挑战传统认知:可解释性可与 LLM 能力同步扩展 — andreas_madsen · 2026-08-11