OpenAI 团队成员自评 Astra:更强更可信,但代码冗余、确认请求过频
every · x · 2026-09-04
OpenAI 团队成员 Yan Dubinsky 发布 Astra 上线总结,随后 Every 引用并推荐其评测:
亮点
- 明显更聪明(评测基准接近饱和)
- 对齐与可信度显著提升
- CUA(computer use)更强,如在 Blender 里建了一座房子
已知问题
- 代码 slop(冗余低质代码)过多
- 请求确认过于频繁,显得「偷懒」——本意是让聪明的模型更谨慎,但可能矫枉过正,团队表示下版修复
所属事件:OpenAI 发布 GPT-6 Astra,团队自评更聪明但代码冗余待修(6 条相关)→
「模型」频道最新
- OpenAI发布GPT-6 Astra:DeepSWE达75.2%,主打的不是跑分是自主修bug — koltregaskes · 2026-09-04
- Grok 盘点 OpenAI 迭代节奏:Sol 到 Astra 仅隔 2 个月 — msg · 2026-09-04
- GPT-6 Astra 上线 Microsoft Foundry,定位工作场景前沿模型 — DanWahlin · 2026-09-04
- Astra 的 ARC-AGI-3 成绩遭质疑:是实力还是又「作弊」了? — jayokunle · 2026-09-04
- Reddit 网友求推荐:那些几乎无人讨论的冷门文本与编码模型 — w6auw · 2026-09-04
- 「Opus 3 的魔力来自它的身体感」:AI 圈津津乐道的模型人格观察 — repligate · 2026-09-04