Cursor 的 Composer 2.5 推理明显弱于 Kimi 基座模型
gleech · x · 2026-07-23
引述的一组 launch post 指向一个猜想:post-training 的能力边界可能比想象中更硬。
由 @ncznc 和 @peligrietzer 做的实验显示,Cursor 的 Composer 2.5 和它的 Kimi 基座模型表现差异很大,而且在推理上 差了不少。另一位研究者的反应是:这构成了一个反对“强 RL 泛化很容易”的自然实验,不过在很多实际场景里,靠规模扩张也许仍能部分掩盖这些短板。
「编程与Agent」频道最新
- 用户称 Linear 的 Slack 代理仍缺少记忆、速度和线程上下文 — var_epsilon · 2026-07-23
- 用量化问答做基准,能迅速暴露前沿模型短板 — PtrPomorski · 2026-07-23
- Codex Security 插件回归,能给代码库做威胁建模并生成修复 — reach_vb · 2026-07-23
- Claude Code v2.1.218 把代码审查移到后台子代理 — ashwin-ant · 2026-07-23
- Ninja 推出奖励低 token 效率 agent 的子网 — const_reborn · 2026-07-23
- Bittensor 给子网注册引入矿工抵押并随发放释放 — const_reborn · 2026-07-23