GPT-6 编码大涨但深度推理仍落后,网友押注 Google 率先 AGI
aditipawarr · reddit · 2026-09-04
针对「GPT-6 Astra 在 Artificial Analysis 榜单登顶」的争论,作者认为这恰恰暴露了短板:Astra 在长时程稳定性上接近完美(长上下文不幻觉、不退化),但在 Humanity's Last Exam 上明显低于 Fable,仅接近 8 个月前的 Gemini 3.1 Pro(带工具)。
作者观点:
- HLE 代表极深学术推理,与 DeepSWE、Arc-AGI 一起才决定模型能否在 AA 上跳档
- GPT-6 Astra 只补齐了编码与长时程短板,是「助手型」进步而非科学原创突破;OpenAI 员工暗示今年还有更强的模型
- Google 数据栈最强,若解决幻觉、长时程(3.8 Flash 似已半解决)与学术推理,加上独有世界模型栈,最可能率先 AGI
- Anthropic 预计会聚焦少数窄域以守住优势
「漫话AGI」频道最新
- 哲学家 Bratton 转发观点:停下 AI 将是存在的贫瘠化 — bratton · 2026-09-04
- 三个月实测后反思:LLM 让我效率提升不足 50%,智能形态与人类迥异 — sebkrier · 2026-09-04
- 柏林艺术周论坛探讨 AI 时代艺术的创作、展示与价值判断 — matdryhurst · 2026-09-04
- Astra 算 AGI 吗?五种互相矛盾的定义竟都成立 — sandersted · 2026-09-04
- mitsuhiko 看完 Astra 发布:模型能力加速没有任何放缓迹象 — mitsuhiko · 2026-09-04
- 设想:把 Karpathy「思维算法」直接烧进处理器,绕开大 LLM — McDonaghMatthew · 2026-09-04