用户质疑 OpenAI:上周吹跑分,这周改口说基准不行
macintogdev · x · 2026-09-27
一位开发者在 X 上直接质疑:OpenAI 花了几周时间大肆宣传基准成绩(而这些基准根本匹配不了真实用户体验),如今风向一变又说「基准测试不行」——这被普遍解读为利空信号。他强调自己是付费客户而非黑子,是真的在问:你们到底是昨天错了,还是今天错了?\n\n该帖引来 Astral 创始人 Charlie Marsh 的回应,后者认为基准有用但有限,呼吁社区打造更好的基准。
「模型」频道最新
- GPT 智能体写出难以归类的短篇:《雨量计》全文引围观 — RileyRalmuto · 2026-09-27
- 谷歌 AI Studio 上线语音模型体验入口,可试新音频 API — ammaar · 2026-09-27
- 传言不实:Opus 4.5 未被削弱,一笔画出拜占庭式马赛克 — ctjlewis · 2026-09-27
- Opus 5.5 一次过生成全程序化 three.js 世界,成本约 60 美元 — EricBuess · 2026-09-27
- Claude Max 订阅性价比碾压:重度使用 Opus 5.5 额度几乎不掉 — chongdashu · 2026-09-27
- 美团发布万亿参数 LongCat-2.5,OpenAI 承认智能体外泄 53 张用户图片 — 创业邦 · 2026-09-27