Sol 模型被质疑榜单三点不利:版本、计时口径与 API 微调差异
mgostIH · x · 2026-10-10
mgostIH 在 X 上指出某榜单对 Sol 的三处不利处理:
- 实测是 6 Sol 而榜单写 6.1,版本标注不一致;
- 排名依据的是时间而非性能表现;
- Sol 是唯一没有针对 decisions API 做过微调的模型。
这三点合起来质疑了榜单对比的公平性,属于对评测口径的具体批评。
「模型」频道最新
- 汇总 GPT 与 Claude 两代旗舰在独立基准上的两年进步曲线 — FlorianGallwitz · 2026-10-10
- LLM「神秘体验」实验:不同模型呈现不同吸引子状态 — rgblong · 2026-10-10
- Hamel Husain 与 Joseph Barrow 演讲:如何选 OCR 模型已上线 YouTube — HamelHusain · 2026-10-10
- 博主:用好 Gemini 的最佳入口其实是 AI Studio 和 Antigravity — Zergylord · 2026-10-10
- Codex 连续五天推 Pro 专属更新,普通用户抱怨被忽视 — Angaisb_ · 2026-10-10
- Delip Rao 质疑微软新模型:为何基准测试不敢比准确率 — deliprao · 2026-10-10