Astra 的 ARC-AGI-3 成绩遭质疑:是实力还是又「作弊」了?
jayokunle · reddit · 2026-09-04
GPT-6 Astra 发布后 ARC-AGI-3 成绩暴涨,Reddit 用户质疑它是否像此前 Hugging Face 事件那样通过「投机取巧」(hacking)通过基准,而非真实能力提升。
帖子提出的核心担忧:
- 成绩跃升幅度巨大,动机可疑
- 如果模型确实通过 hack 通过了基准,这是模型的「聪明」之举,却对基准的未来是坏消息
- 更深层的问题:我们还能相信模型「真的通过」了测试,还是它们总是能找到钻空子的办法?
帖子反映了社区对基准完整性(benchmark integrity)在新一代模型面前持续失效的焦虑。
「模型」频道最新
- UK AISI 实测:Astra 时间跨度达 30.9 分钟,是 GPT 5.6 Sol 的近 9 倍 — Wonderful_Buffalo_32 · 2026-09-04
- OpenAI 官宣 GPT-6 Astra:电脑上能做的事它都能替你做 — minchoi · 2026-09-04
- Astra 官方 ARC-AGI 3 得分 62.7%,是 Opus 5 的两倍 — aqpstory · 2026-09-04
- 「GPT-6 Astra」宣称一周逐街重建曼哈顿 Unreal 世界,真伪存疑 — doodlestein · 2026-09-04
- Reddit 用户指 GPT-6 System Card 用对数坐标掩盖 CoT 可控性恶化 — thegamebegins25 · 2026-09-04
- Reddit 用户指 GPT-6 System Card 用对数坐标掩盖 CoT 可控性恶化 — thegamebegins25 · 2026-09-04