Every 用日常工作自建基准实测 GPT-6 Sol 对阵 Opus 5.5

every · x · 2026-09-25

同日 OpenAI 发布 GPT-6 Sol、Anthropic 发布 Claude Opus 5.5,Every 的 Dan Shipper 用自家日常工作任务自建的 benchmark 做了 Vibe Check 横评,结论是"两个模型,一个清晰的取舍"。文章指出跑分之外,更应该用自己真实工作任务来测模型;但正文对付费会员锁定,免费读者只能看到开头。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →