Overnight 基准测试 45% rollout 中途失败,开发者吐槽 OpenAI 容量吃紧
dejavucoder · x · 2026-09-13
开发者 dejavucoder 反映其通宵运行的 benchmark 中有 45% 的 rollout 在回合中途失败,并将原因归结为 OpenAI 近期容量紧张(服务能力不足)。这是 API 稳定性影响 agent 工作流的一手反馈,侧面印证 OpenAI 产能压力对依赖其 API 的自动化任务的实质冲击。
「模型」频道最新
- 爆料称 GPT-6 Astra 距 GPT-5.6 Sol 发布仅八周,或成最快迭代绝唱 — kimmonismus · 2026-09-13
- 标注 8 万余条数据微调 Qwen 3.8,写作品质盲测提升 86% — Scobleizer · 2026-09-13
- 实测 Muse Spark 1.3 与 Fable 5.1 并列第一,Meta 杀入前沿 — PawelHuryn · 2026-09-13
- 公开报告显示前沿模型内部与公开版滞后约1-3个月 — xeophon · 2026-09-13
- 网友指 DeepSeek V4.1 Flash 疑似被公开 benchmark 污染 — teortaxesTex · 2026-09-13
- 用 Gemini 翻译 swarm 语言与英文互译,效果出奇地好 — xeophon · 2026-09-13