Arena 实测 Claude Sonnet 5.5 与 GPT-6.1 Sol:小模型能否以零头价格逼近旗舰
arena · x · 2026-10-01
- AI 竞技场团队对 Claude Sonnet 5.5 与 GPT-6.1 Sol 做了一次并排实测,核心问题是:这两款小型号能否以远低于 Fable、Opus、Astra 等旗舰模型的成本,交出接近旗舰的结果。
- 测试用多个 prompt 跑同一任务,逐项追踪每个模型代的实际花费,并与同厂商更大模型的表现对比。
- 完整对比结果由 @petergostev 制作,发布在 arena 的 YouTube 频道上。
「模型」频道最新
- Gemini 4 Argon 全面超越 Astra 与 Opus 5.5,Google 杀回赛场 — Yuchenj_UW · 2026-10-01
- 新模型长程编码 FrontierSWE v2 达 55%,远超 Gemini 3.x 的 20% — xennygrimmato_ · 2026-10-01
- Gemini 4 Argon 高推理模式完整基准结果出炉 — ArtificialAnlys · 2026-10-01
- Gemini 4 Argon 登顶 AutomationBench,领先 Claude Sonnet 5.5 六个百分点 — ArtificialAnlys · 2026-10-01
- GPT-6.1 Sol 缓存输入 $0.10/M:长任务 Agent 账单真正由它决定 — victor_explore · 2026-10-01
- Gemini 4 Argon 定价激进:比 Opus 便宜一半,比 GPT-6 便宜五倍 — haider1 · 2026-10-01