论文发现 LLM「mode-hopping」:40B token 内准确率 81%→0%→81.7%
jiaxinwen22 · x · 2026-10-01
一篇新论文发现 LLM 预训练中存在「mode-hopping」现象:模型在训练损失保持平稳的情况下,会在浅层模式匹配与真正泛化之间反复切换。
- 典型案例:OLMo3-32B 在仅 40B 训练 token 内,准确率从 81% 跌到 0%,又回升到 81.7%。
- checkpoint 选择的反直觉结论:选更早的 4.5T-token checkpoint 而非 4.9T 的,数学微调后的 GPQA 迁移更高(36.3% vs 29.8%),对 alignment attack 的鲁棒性也更强(53% vs 21%)。
- 含义:更多预训练不一定带来更好的泛化,后期训练/微调前的 checkpoint 选择值得基于这类动态重新审视。
「研究」频道最新
- 新论文实证:LLM 答案正确,思维链步骤却可能是无效的 — rao2z · 2026-10-01
- Gemini 3.8 Flash 高配版 WeirdML v2 拿 84.8%,首超 Gemini 3.1 Pro — teortaxesTex · 2026-10-01
- 研究:加密思维链可跨会话重放,窃取 Claude/OpenAI/Google 前沿模型隐藏推理 — maksym_andr · 2026-10-01
- 从几何视角理解 ML:ReLU、LayerNorm、LoRA 与向量量化的统一直觉 — techNmak · 2026-10-01
- Nature 论文发布首个超人 Stratego AI,靠 RL 与测试时计算取胜 — zicokolter · 2026-10-01
- Open Scientific Intelligence 黑客松 10 月开赛,奖金超 1.5 万美元 — BenBlaiszik · 2026-10-01