Cognition 发布 SWE-2 编码模型:距 Fable 5.1 仅 1 分,便宜 64%
AxSaucedo · x · 2026-09-19
- Cognition 发布最新编程模型 SWE-2,在 FrontierCode 1.1 Main 上取得 50.0%,距榜首 Fable 5.1 仅 1 分,而成本低 64%。
- 关键训练进展:首次将 RL 扩展到多万亿参数规模,新增的 RL 算法可在单次训练中同时覆盖所有 reasoning-effort 级别,整体推动成本-性能 Pareto 前沿。
- SWE-2 基于 Kimi K3(2.8T 参数、已经过大量 agentic coding RL)做后训练,RL 仍在多数基准上再提升 5–6 分。
- 主要成绩:DeepSWE 1.1 达 73.0%,Terminal-Bench 2.1 达 92.8%,在分数和成本上均超越 SWE-1.7 与 Grok 4.6,以极低价格匹敌 GPT-5.6 Sol 与 Fable 5/5.1,并以 1/4 成本逼近 GPT-6 Astra。
- 博客还介绍了成本惩罚(cost penalties)等后训练细节,说明如何按各 effort 级别的局部斜率调参。
「编程与Agent」频道最新
- 网友用 Jev 做浏览器扩展,自动打标签分析你上网都在看啥 — pramodk73 · 2026-09-19
- 一条 prompt 花 1 美元 5 分钟,用编码 Agent 搭出完整 Django 应用 — Al_Grigor · 2026-09-19
- Agent 接多个视频模型:一个通用工具还是每家各建一个? — ExcitingBison4616 · 2026-09-19
- Readback 开源插件:让 Claude Code 的回复用语音读给你听 — shauntrennery · 2026-09-19
- GitHub Next 开源 LocalJev:用 oMLX 本地复刻 Jev 决策 API — gaganghotra_ · 2026-09-19
- WebMCP 实测:成本仅为 GPT-6 Astra 1/112,任务全解 — hardimanjames · 2026-09-19