Liquid AI 开源 antidoom 训练法:用 FTPO 破解小模型 doom loop
helloiamleonie · x · 2026-09-15
Liquid AI 的 Leonie 指出,小模型 + 具备思考能力 + 复杂任务的组合容易陷入「doom loop」:模型在思考过程中反复打转、无法收敛到答案。
Liquid AI 的解法是「antidoom」训练,核心技术为 FTPO(Final Token Preference Optimization)——在偏好优化时针对最后一个 token 施加偏好信号,让模型学会跳出循环。官方已开源完整教程 notebook(基于 TRL 自定义 DPOTrainer 实现),内容涵盖:doom loop 成因、FTPO 原理、以及如何用 TRL 写自定义 Trainer 落地。仓库为 Liquid4All/cookbook(2.5k star)。
所属事件:Liquid AI 开源 FTPO 训练法破解小模型厄运循环(2 条相关)→
「编程与Agent」频道最新
- LangChain:每个托管Deep Agent都是MCP server,可被Agent当工具调用 — LangChain · 2026-09-16
- LlamaIndex 复盘用 Stainless 生成 SDK,团队已加入 Anthropic — llama_index · 2026-09-16
- HappyRobot CEO:SE 转型 FDE 缺的不是技术,而是重新设计系统的权限 — ivory_tang · 2026-09-16
- 吴恩达称 prompting 六个月内将被 loops 与 graphs 取代 — Roger_M_Taylor · 2026-09-15
- 同一实测:21 次运行没有一个模型设计出我愿意穿的 T 恤 — hazelcough · 2026-09-15
- 实测 7 个模型建 T 恤店:模型宁凭权重写旧代码,也不查最新文档 — hazelcough · 2026-09-15