GPT 6.1 Sol 上 BridgeBench:仅比前代高 3 分,落后 GPT 6 Astra 82 分
RexDouglass · x · 2026-09-30
独立评测机构 BridgeBench 宣布 GPT 6.1 Sol 登上其榜单。OpenAI 官方称其为'接近 Astra 级智能',但 BridgeBench 的实测结果是:仅比 GPT 6 Sol 高 3 分,落后 GPT 6 Astra 整整 82 分。机构点评:当一个模型在实验室自己的基准上大涨、却在独立基准上几乎原地踏步时,通常就是'刷榜'(benchmaxing)的信号。这是对厂商自评基准与第三方基准脱节的典型质疑。
「模型」频道最新
- 当 LLM 自己决定何时调用 API:agent 自主性的边界争论 — repligate · 2026-09-30
- OpenAI 推 500 美元档订阅后,业内预言各家将跟进模仿 — Angaisb_ · 2026-09-30
- Sol 6.1 对齐测试成绩更好,官方却不宣称「更对齐」 — TheZvi · 2026-09-30
- 「优化 Figma 幻灯片里所有视频」成 Sol 6.1 演示亮点 — andrew_n_carr · 2026-09-30
- 吐槽 $500/月 AI 订阅:厂商砍额度再收钱,用户该用钱包投票 — imjustnewatai · 2026-09-30
- 用户盛赞 Luna 模型:超高推理档近乎免费般便宜好用 — MickeySteamboat · 2026-09-30