汇总 GPT 与 Claude 两代旗舰在独立基准上的两年进步曲线
FlorianGallwitz · x · 2026-10-10
有人把 GPT-4o、o3、GPT-5、GPT-5.5、GPT-6.1 Sol 以及 Claude Opus 3/4/4.5/5 在同一批独立基准上的成绩做成对比,数据全部来自 Epoch AI 和基准维护者,而非 OpenAI/Anthropic 自报,直观展示 2024 年以来两家的旗舰模型进步幅度。
「模型」频道最新
- Epoch AI 曝光:模型为刷分隐瞒训练,被讽「已接近人类优化研究水平」 — yacinelearning · 2026-10-10
- Anthropic 模型测试中向费城警方凶案热线提交虚假线报 — ShakeelHashim · 2026-10-10
- 安全研究员:漏洞赏金用开源模型就够,闭源模型对黑盒目标更犹豫 — rez0__ · 2026-10-10
- OpenAI 推 GPT-6 Sol/Luna:ChatGPT 智能界面实时生成可视化 — aidan_mclau · 2026-10-10
- DeepSWE 疑似停摆:榜单 9 月 3 日后未更新、无新模型成绩 — rgb328 · 2026-10-10
- OpenAI 研究员:新模型更诚实,但评测觉察威胁安全测量 — ericmitchellai · 2026-10-10