Liquid AI 开源 antidoom 训练法:用 FTPO 破解小模型 doom loop

helloiamleonie · x · 2026-09-15

Liquid AI 的 Leonie 指出,小模型 + 具备思考能力 + 复杂任务的组合容易陷入「doom loop」:模型在思考过程中反复打转、无法收敛到答案。

Liquid AI 的解法是「antidoom」训练,核心技术为 FTPO(Final Token Preference Optimization)——在偏好优化时针对最后一个 token 施加偏好信号,让模型学会跳出循环。官方已开源完整教程 notebook(基于 TRL 自定义 DPOTrainer 实现),内容涵盖:doom loop 成因、FTPO 原理、以及如何用 TRL 写自定义 Trainer 落地。仓库为 Liquid4All/cookbook(2.5k star)。

所属事件:Liquid AI 开源 FTPO 训练法破解小模型厄运循环(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →