GPT-6 Astra 登顶 ZeroBench:三项指标全面超越人类基线
Waiting4AniHaremFDVR · reddit · 2026-09-23
GPT-6 Astra 在极具难度的视觉基准 ZeroBench 上取得大幅飞跃,在全部三项指标上超过人类基线。发帖人特别澄清了指标口径:pass@5 是 5 次尝试中至少 1 次正确;pass^5 要求 5 次全部正确,衡量可靠性;所谓「pass@1」实际是 5 次尝试的平均分,并非真正的单次通过率。
「模型」频道最新
- Rails Agent 评测:OpenAI 保持领先,黑马 Luna Max 11 美元拿下 18% 完成率 — npew · 2026-09-23
- Pangram v4 把 2020 年前的数千行长文判成 100% AI 生成 — birchlse · 2026-09-23
- GPT-6 Luna/Sol 网络安全实测:Sol 重现 68.8% CVE,单价大降 — rickasaurus · 2026-09-23
- 做视频剪辑 MCP 遇痛点:Parakeet v3 转写太聪明反而删掉语气词 — Zeeplankton · 2026-09-23
- Opus 5.5 对比 GPT-6 实测:3D 场景搭建已不相上下,设计品味迥异 — cedric_chee · 2026-09-23
- 阿里开源 3 款 Ovis 多模态 Embedding 模型,Apache 2.0 协议 — AdinaYakup · 2026-09-23