GPT-6 Astra 实测: computer use 与科学任务强,但此前被过度炒作
davidthesong · reddit · 2026-09-04
网友发帖称 OpenAI 的 GPT-6 Astra 在基准对比中表现接近 Fable,且在 computer use(电脑操作)与科学类任务上更强,但认为该模型发布前「确实被有点过度炒作了」。帖主征集其他用户在各自使用场景下的实测反馈。链接指向 benchmarklist.com 的模型评测页。
所属事件:GPT-6 Astra 实测:跑分平平但实用体验获用户辩护(2 条相关)→
「模型」频道最新
- 基准测试失控:新模型评测被叙事牵着走,该用能力向量取代排行榜 — GlenBradley · 2026-09-04
- 评测榜洗牌:Meta 小模型 Muse Spark 力压 Astra DeepSwe — altryne · 2026-09-04
- 开发者炮轰 OpenAI 分级首发:背弃了『开放』的立司使命 — ctjlewis · 2026-09-04
- IFM 新开源 K2-Horizon-MoVA-36B-A4B 引热议:对标 Qwen 3.6 35B 值不值得试? — edward-dev · 2026-09-04
- 花 40 美元跑实验压降评估成本,开发者:买不起智能真难用 AI — zeeg · 2026-09-04
- GPT-6 Astra 对比 Claude Fable 5.1:互有胜负同价 — DataLearnerAI · 2026-09-04