Liquid AI 提出 Antidoom 训练,将模型死循环率从 10% 降至 1%

helloiamleonie · x · 2026-09-25

作者科普了 RLVR(可验证奖励的强化学习):从模型回答中抽取最终答案与真值比对来打分。但这种方式奖励信号稀疏,长多轮生成时效率低。

为解决此问题,其团队提出 antidoom training:检测 doom loop(死循环),找到触发死循环的第一个 token,对其 reject 并降采样,同时对替代 token 升采样。在 LFM2.5-2.6B 上,该技术把死循环率从约 10% 降到 1%。

所属事件:Liquid AI 发布 LFM2.5-2.6B 并拆解端侧训练配方(10 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →