FTPO 训练法将小模型“厄运循环”率从 10.2% 降至 1.4%
helloiamleonie · x · 2026-09-15
Liquid AI 发布博客并开源了 "Antidoom" 训练方法,解决小推理模型在难题上反复输出 "Wait, let me reconsider…" 等片段直至耗尽上下文的 "doom loop"(厄运循环)问题。
方法要点
- 常见的 repetitionpenalty 只是推理时打补丁,可能损害性能;强化学习又需要精细奖励和昂贵的在线 rollout。
- FTPO(Final Token Preference Optimization):定位触发循环的那个确切 token,只在该位置用 chosen/rejected 偏好对训练模型选择连贯的替代 token,其余分布基本不动。方法改编自 Antislop。
- 基于 TRL 实现自定义 DPOTrainer,代码与教程均已开源。
效果:在 LFM2.5-2.6B 早期 checkpoint 上,困难数学与编码题的循环率从 10.2% 降到 1.4%,且各项评测成绩因循环减少而全面提升。
所属事件:Liquid AI 开源 FTPO 训练法破解小模型厄运循环(2 条相关)→
「模型」频道最新
- OpenAI 语音服务降价 60%,并推出 ChatGPT 礼品卡 — borowcy · 2026-09-16
- 长文详解:为什么本地跑推理模型是刚需,你需要无审查模型 — HankYeomans · 2026-09-15
- KoboldCpp 发布 v1.121 版本 — Fcking_Chuck · 2026-09-15
- CritPt 基准纠错后 GPT-5.6 pass@4 冲至 94.4% — bookwormengr · 2026-09-15
- 网友本地实测越狱版 Qwen:30 分钟即可生成详细暴力策划内容 — InTheZ3n · 2026-09-15
- 徐冰:现有 AI 还做不了超高要求软件,Grok 需更多 RL 与更强 harness — bingxu_ · 2026-09-15