Cursor CEO:复杂任务下前沿模型集体拉胯,表现大同小异
zeeg · x · 2026-10-05
Cursor CEO Zeeg 不认可 Astra 模型真正比 Sol 更强的说法。他指出,无论哪个模型,一旦接到非常复杂的任务,都会以相当相似的方式暴露短板:比如 Astra 倾向于绕开主路做局部小修小补,而不是做更系统的重新评估——这还是在 max effort 设定下的表现。他由此好奇各家实验室用来让模型「越界」的评测 harness 到底长什么样。
「模型」频道最新
- 资深制作人批 Suno:过拟合数据集,能力不进反退 — teropa · 2026-10-05
- 预注册预测:普通技术用户将难分辨前沿模型与蒸馏版 — teortaxesTex · 2026-10-05
- 用户报告 GLM-5.3 偶发自说中文且抗指令 — khademinori · 2026-10-05
- Grok 4.7 登陆亚马逊 Bedrock 与谷歌企业平台 — tetsuoai · 2026-10-05
- xAI 语音转写模型 1.0 退役,请求自动切至 2.0 同价 — tetsuoai · 2026-10-05
- 开源网络安全模型 apex-flash-1 发布,靠挖洞赏金已赚 100 万美元 — glenbeer · 2026-10-05