Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线
YouJiacheng · x · 2026-09-11
- Cognition 介绍 SWE-2 是其首个支持 effort 等级(effort levels)的编码模型,为此显著改进了长度惩罚(length penalty)的训练配方。
- 团队用单次 RL 训练即可同时提升效果并保持 Pareto 曲线形状:medium effort 档位变得更便宜也更聪明;max effort 档位则学会使用更多 token 与轮次来拿下最高分。
- @RichardYRLi 点评称,很高兴看到 KKT(对偶性)论证出现在现代 LLM RL 应用中,暗示该方法在理论上有对偶/约束优化的依据。
- 细节见 Cognition 博客。
「编程与Agent」频道最新
- Warp 六个非工程团队全用 Linear 和 Claude Code 工程化运作 — mon__lim · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11