学者评 Astra 编程:不如预期,或仅 GUI 操控是质变点
May_F1_ · x · 2026-09-08
- NLP 学者 Graham Neubig(g neubig)表示对 Astra 在编程场景的表现有些失望。
- 他认为 Astra 确实很强,但「5.6 sol」也很强,两者都远谈不上完美——暗示编程能力上的代际提升不明显。
- 他猜测真正的阶跃式进步可能在 GUI 计算机操控方向,并征集被其震撼的真实用例。
- 这是来自知名工具(SWE-bench 作者)作者对新模型编程能力的第一手评价,反映社区对新旗舰模型「不够惊艳」的普遍感受。
「模型」频道最新
- GPT-6 Astra 机器人任务 95% 得分遭质疑:演示难度被美化 — GaryMarcus · 2026-09-08
- 重度用户实测 Astra 后直言:还不是 AGI,只是更强代码猴 — GaryMarcus · 2026-09-08
- OpenAI 官方宣布:全球重置所有付费订阅用量,今天 6 点生效 — jasonkneen · 2026-09-08
- Epoch 研究:Astra 打牌超人类但几乎无持续学习 — teortaxesTex · 2026-09-08
- GPT-6 Astra 额度已重置,用满的用户可继续使用 — xiaohu · 2026-09-08
- Astra 计算机使用速度惊人,或为提前规划批量执行 — shekitup · 2026-09-08