FTPO 方法修复小模型长推理死循环

SergioPaniego · x · 2026-08-28

阅读 LiquidAI 的 Antidoom 报告发现:小模型在长思考链和难题上容易陷入死循环(重复“Wait”等词),LFM2.5-2.6B 和 Qwen3.5-4B 早期检查点的发生率分别为 10.2% 和 22.9%。

修复方法是 FTPO (Final Token Preference Optimization)。它与 DPO 的关键区别在于:

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →