论文发现 LLM「mode-hopping」:40B token 内准确率 81%→0%→81.7%

jiaxinwen22 · x · 2026-10-01

一篇新论文发现 LLM 预训练中存在「mode-hopping」现象:模型在训练损失保持平稳的情况下,会在浅层模式匹配与真正泛化之间反复切换。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →