Cognition 发布 SWE-2 号称媲美前沿模型,被质疑挑有利榜单宣传
steipete · x · 2026-09-11
Cognition 官宣发布 SWE-2,称其为迄今最接近前沿水平的模型:在主流评测上与近期前沿模型打平,成本最高低 70%;通过把 RL 扩展到数万亿参数规模,在能力与成本两条线上同时推进 Pareto 曲线。
但这条推文的核心是 @initjean 的质疑:Cognition 只公布了对己有利的 Terminal-Bench 2.1 成绩,却回避了 Terminal-Bench 4 的结果。发帖人 steipete 转发并呼应「分数不差,但要诚实」——暗示新模型在更新的基准上表现可能不如宣传。
所属事件:Cognition 发布 SWE-2 编码模型:比肩前沿、成本最高降 70%(7 条相关)→
「模型」频道最新
- 用户吐槽 Astra 额度比 Fable 更坑:一天烧光一周配额 — cocktailpeanut · 2026-09-11
- DeepSeek V4.1 Flash 架构解析:552B MoE 读写算力不对称省上下文成本 — demian_ai · 2026-09-11
- 知情人:Codex 选择性加入数据进训练的可能性为零 — soumitrashukla9 · 2026-09-11
- Epoch AI 数学基准 14 个月从 5% 飙至 98%,宣布饱和 — Jsevillamol · 2026-09-11
- FrontierMath Tier 4 全军覆没:GPT-6 Astra 解出最后一题 — Jsevillamol · 2026-09-11
- Anthropic 披露:阿里 1.51 亿次调用蒸馏 Claude,Kimi、DeepSeek 也涉其中 — likeastar20 · 2026-09-11