实测案例:Opus 5.5 在架构级任务上明显胜过 GPT-6 Sol

DataLearnerAI · reddit · 2026-09-26

开发者分享一个真实案例:在给 LLMLearner 项目添加 benchmark 集合概念时,先用 GPT-6 Sol Medium 直接实现了新 collections 模型(表、API、管理逻辑),并成功上线。随后让 Opus 5.5 Medium 审查设计,Opus 立刻指出抽象本身是错的——项目已有 benchmark 身份、版本族、分类体系和数据源等概念,新集合层与它们重叠,等于再造一套身份系统;且作者把「同一 benchmark 的不同版本」「同一平台的不同 benchmark」「多 benchmark 聚合排名」三种不同关系混为一谈。Opus 基于已有概念提出了更干净的结构。

作者总结:GPT-6 Sol 只是实现了功能,Opus 则退一步理解系统并质疑建模方式本身。就代码库级架构工作而言,Opus 5.5 Medium 明显更强,甚至 GPT-6 Sol 在这类任务上还不如 5.6 Sol。作者强调这只是单一个案而非基准测试。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →