OpenAI 员工称 scaling 撞墙:瓶颈在评测全面饱和
willdepue · x · 2026-09-04
OpenAI 员工 willdepue 发文称 scaling 已经撞墙,而这堵墙 100% 是评测饱和:现有 benchmark 已被刷满,难以区分模型进步。这与同期 GPT-6 发布无评测成绩的观感相呼应,指向行业缺新基准的困境。
「模型」频道最新
- Astra 从低算力到满配解决率几乎不变,RL 扩展故事遭数据打脸 — zainhas · 2026-09-05
- Sam Altman:下一代模型会让所有人清醒, capability 远超现有水平 — ChrisGPT · 2026-09-05
- 实测发现 Astra 高努力档空耗 token,terminal bench 上仅低中高档可用 — zainhas · 2026-09-05
- GPT 6 Astra 支持对话中途调整推理强度且缓存不失效 — intellectronica · 2026-09-05
- 「别用过去式称呼模型」:网友惋惜 Opus 3 时代落幕 — repligate · 2026-09-05
- Astra 以 30k tokens 跑出 74% DeepSWE 成绩,效率碾压 GPT-5.6 Sol — haider1 · 2026-09-05