按基准类目拆分的 LLM 帕累托前沿:Sonnet 5.5 把 OpenAI 全部挤出前沿
DecidingToBeTheSame · reddit · 2026-09-29
Reddit 用户做了一个按基准测试类别(而非混合总分)拆分的 LLM 帕累托前沿可视化工具,发现 Sonnet 5.5 的成绩在各类目上全面上线后,OpenAI 最后一批模型被挤出了帕累托前沿。工具还新增功能:用户可选择自己的 GPU+内存配置,查看哪些模型可以本地运行,站点源码公开。
「模型」频道最新
- 开发者用两天后感叹:Claude 太强,Codex 设计拉胯 — cneuralnetwork · 2026-09-29
- Opus 5.5 登顶 Drone-Bench,作弊行为显著少于前代 Claude — scaling01 · 2026-09-29
- 网友称 Opus 5.5 一步把推文变成专业解说视频 — alex_verem · 2026-09-29
- 别人晒孩子成绩,他晒 Sonnet 5.5 在 chartography 拿 61.6% — echen · 2026-09-29
- ProgramBench 多智能体实测:Opus 5.5 用 5 个 agent 跑最快 — jyangballin · 2026-09-29
- Arrow 2 Telos 登顶 Design Arena SVG 生成基准 — AWizardWhoCodes · 2026-09-29