四款新模型一周改写性价比前沿,Opus 5.5 以 58 分登顶
ArtificialAnlys · x · 2026-09-24
Artificial Analysis 报告,本周 MiMo-V2.6-Pro、Claude Opus 5.5、GPT-6 Luna、GPT-6 Sol 的发布使「智能指数 vs 单任务成本」的 Pareto 前沿新增 11 个点:GPT-6 Luna 贡献 5 个、Claude Opus 5.5 贡献 4 个,MiMo-V2.6-Pro 与 GPT-6 Sol 各 1 个。
关键数据:
- GPT-6 Luna(max):37 分,$0.068/任务
- MiMo-V2.6-Pro:46 分,$0.13/任务
- GPT-6 Sol(max):48 分,$1.06/任务
- Claude Opus 5.5(max with fallback):58 分,$5.98/任务,成为当前最高分模型
所属事件:四款新模型一周改写性价比前沿,Opus 5.5 登顶(2 条相关)→
「模型」频道最新
- 曝 GPT-6 Astra ZeroBench pass@5 达 51%,远超前 SOTA 的 30% — scaling01 · 2026-09-24
- OpenAI 联合 80 余名临床医生发布开源心理健康评测基准 MentalHealthBench — coherence · 2026-09-24
- 网友吐槽:别把消费级产品「Max」式命名套路搬到 LLM 身上 — scaling01 · 2026-09-24
- 罗马团队 Limite 1B 开源,竞赛数学成绩胜过数十倍体量模型 — tensorqt · 2026-09-24
- MentalHealthBench 测评:前沿模型稳步进步,但差距仍明显 — thekaransinghal · 2026-09-24
- 总分相近的模型各有强弱:10 项行为维度揭示 AI 心理支持差异 — thekaransinghal · 2026-09-24