第三方实测 Opus 5.5 与 GPT-6 系列:100 个开放编程环境横评
sandersted · x · 2026-09-24
一组研究者在 100 个开放式编程与工程环境中实测 Opus 5.5、GPT-6-Sol 与 GPT-6-Luna,结论与 AAII 的评测明显分歧。
- GPT-6-Astra 仍以明显优势保持前沿最强。
- Opus 5.5 在各编程类目排名第 27,其中一次性代码生成(one-shot)能力居第二——该指标与流体智力相关性最高。
- 团队未测易用性,但体感其沟通风格有改善;更低的定价受欢迎,被称为 Anthropic 首个定价合理的模型。
- 值得注意的反常:Opus 5.5 在他们的自建评测框架中表现不佳,这一模式自 Fable 5.1 起就存在——one-shot 流体智力得分好于 agentic 结果。
「模型」频道最新
- 用户质疑 OpenAI 用 Sol 换皮 Terra 降价却砍用量额度 — RexDouglass · 2026-09-24
- 生成 demoscene demo 只用掉 Opus 5.5 周额度的不到 3% — gandamu_ml · 2026-09-24
- 研究者发现 Mythos 激活方向与基因组语言模型惊人相似 — jatin_n0 · 2026-09-24
- 物理场景实测:GLM-5.3 牛顿摆完胜隐身新模型 Space Bunny Alpha — rohanpaul_ai · 2026-09-24
- theo 锐评模型格局:Anthropic 缺小模型,OpenAI 缺大模型 — james_mtc · 2026-09-24
- Together AI 开源决策模型 tev1:基于 Qwen3.5 4B,附完整数据配方与微调代码 — nutlope · 2026-09-24