开发者揭示大模型微调脆弱性:数据重复易致崩溃

近期多位开发者揭示了大语言模型在训练与微调过程中的高度脆弱性。有分析指出,在 GRPO 训练中,若连续批次包含大量相同的罕见词,这种数据软重复会导致梯度爆炸,使仅经历两步训练的模型就退化为输出乱码。这表明,即便技术日益成熟,大模型在面对数据重复等基础问题时仍极易引发不稳定,而量化操作则会进一步加剧这种崩溃风险。

2026-08-02 ~ 2026-08-02 · 3 条相关