Every 用日常工作自建基准实测 GPT-6 Sol 对阵 Opus 5.5
every · x · 2026-09-25
同日 OpenAI 发布 GPT-6 Sol、Anthropic 发布 Claude Opus 5.5,Every 的 Dan Shipper 用自家日常工作任务自建的 benchmark 做了 Vibe Check 横评,结论是"两个模型,一个清晰的取舍"。文章指出跑分之外,更应该用自己真实工作任务来测模型;但正文对付费会员锁定,免费读者只能看到开头。
「模型」频道最新
- Opus 5.5 一条提示词复刻 Minecraft:1 小时约 20 美元搞定 — amasad · 2026-09-25
- 用户实测:Opus 新版 Medium 推理档表现佳,High 反显多余 — rudrank · 2026-09-25
- PINNACLE 评测:GPT-6 Sol 拉满思考力错误降 2.5 倍,Claude Opus 5.5 无效 — ryanshrout · 2026-09-25
- 4B 开源小模型登顶 JevBench,靠更快更便宜击败大模型 — airesearch12 · 2026-09-25
- Terminal-Bench-Science 榜单上线:GPT-6 Astra 与 Claude Opus 5.5 领跑 — scaling01 · 2026-09-25
- 用户晒 Opus 5.5 文风进化:终于能删掉「别写得像二货」自定义指令 — generativist · 2026-09-25