Cursor 的 Composer 2.5 推理明显弱于 Kimi 基座模型

gleech · x · 2026-07-23

引述的一组 launch post 指向一个猜想:post-training 的能力边界可能比想象中更硬。

由 @ncznc 和 @peligrietzer 做的实验显示,Cursor 的 Composer 2.5 和它的 Kimi 基座模型表现差异很大,而且在推理上 差了不少。另一位研究者的反应是:这构成了一个反对“强 RL 泛化很容易”的自然实验,不过在很多实际场景里,靠规模扩张也许仍能部分掩盖这些短板。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →