FTPO 方法修复小模型长推理死循环
SergioPaniego · x · 2026-08-28
阅读 LiquidAI 的 Antidoom 报告发现:小模型在长思考链和难题上容易陷入死循环(重复“Wait”等词),LFM2.5-2.6B 和 Qwen3.5-4B 早期检查点的发生率分别为 10.2% 和 22.9%。
修复方法是 FTPO (Final Token Preference Optimization)。它与 DPO 的关键区别在于:
- 仅针对生成中途的单个 token 位置训练,而非整个序列;
- 将概率分散给约 20 种合理替代词,而非简单替换过拟合 token;
- 更精准地切断重复循环的起始点。
「研究」频道最新
- SSMB:直接在运动模糊图像上做自监督关键点检测 — zhenjun_zhao · 2026-08-28
- 自变量机器人发布 WALL-SS:长时程机器人仿真,成功率相关系数 0.93 — chris_j_paxton · 2026-08-28
- 阿里 Accio 发布 CommerceAgentBench:107 个真实电商任务验证智能体执行 — future_coded · 2026-08-28
- 新论文批判性评估VASCO研究:卫星前地球轨道物体说法存疑 — DanielWhiteson · 2026-08-28
- 艾伦研究所视频展示神经元连接并非随机,揭示连接组学奥秘 — CatAstro_Piyush · 2026-08-28
- Cloudflare 优化 1.1.1.1 DNS 缓存:5 处改动省下 100TB 内存 — ritakozlov · 2026-08-28