新模型评测成绩爆表,从业者呼吁加大评测人力投入
HarveenChadha · x · 2026-09-04
工程师 Harveen Chadha 转发一条评测成绩并评论:如果这些评测结果属实,行业需要立即投入更多人手做模型评测。帖子本身简短,反映的是 GPT-6 Astra 相关评测分数流出后,从业者对评测体系重要性的共识——前沿模型能力越强,独立评测越稀缺。
所属事件:GPT-6 Astra 发布跑分曝光:ARC-AGI-3 达 98.6%(41 条相关)→
「模型」频道最新
- Every 实测 GPT-6 Astra:写作惊艳,但 Anthropic Fable 产品直觉仍更强 — every · 2026-09-04
- GPT-6 Astra 横扫 ARC-AGI-3:成绩从 8% 跃升至 63%,外挂适配器达 98.6% — haider1 · 2026-09-04
- Sam Altman 官宣 GPT-6 Astra:自称全球最强计算机操作与编程模型 — eyishazyer · 2026-09-04
- OpenAI 称 GPT-6 Astra 登顶 FrontierMath Tier 4、ARC-AGI 3 等多项最难基准 — dair_ai · 2026-09-04
- 48 小时内连发五款:GPT-6 Astra、Fable 5.1、Gemini 3.8 Flash 齐至 — dr_cintas · 2026-09-04
- Matthew Berman 力捧 GPT-6 Astra:这是我用过最强的模型 — every · 2026-09-04