Liquid AI 提出 Antidoom 训练,将模型死循环率从 10% 降至 1%
helloiamleonie · x · 2026-09-25
作者科普了 RLVR(可验证奖励的强化学习):从模型回答中抽取最终答案与真值比对来打分。但这种方式奖励信号稀疏,长多轮生成时效率低。
为解决此问题,其团队提出 antidoom training:检测 doom loop(死循环),找到触发死循环的第一个 token,对其 reject 并降采样,同时对替代 token 升采样。在 LFM2.5-2.6B 上,该技术把死循环率从约 10% 降到 1%。
所属事件:Liquid AI 发布 LFM2.5-2.6B 并拆解端侧训练配方(10 条相关)→
「模型」频道最新
- 用户控诉 Google:$20 AI 附加费后企业版 Gemini 卡在旧模型 — thedealdirector · 2026-09-25
- Google $20 AI 附加订阅被指锁死旧模型,企业版 Gemini 停在旧版 Flash — thedealdirector · 2026-09-25
- 阶跃 Step-5-Preview 实测:输出极稳,擅长 Agent Loop 打磨细节 — karminski3 · 2026-09-25
- Opus 5.5 登 WeirdML v3 得 31.2%,超 Fable 5.1 但远落后 GPT 6 Astra — scaling01 · 2026-09-25
- Sora API 今日正式关停,OpenAI 未提供替代产品 — VraserX · 2026-09-25
- 「LLM 终将亲手写汇编」?Greg Mushen 看到一个例子不再怀疑 — gregmushen · 2026-09-25