企业级开发实测:主流基准跑分与真实任务严重错配

DivideHorror3217 · reddit · 2026-09-19

作者(数据分析背景、非职业开发者)用 AI 搭建了多用户数据管理平台,烧掉两个 200 美元账号后,让模型评估「同样的活能不能用 Opus 4.6 干完」。

模型一开始机械复读「27B 模型做不了」,完全无视 Opus 4.6 与 Qwen3.8 27B 基准成绩相近这一事实。换一种问法(「朋友说我用 Opus 5 / Sol 5.6 xhigh 是不是杀鸡用牛刀」)后,模型承认:对这类企业仓库式编码任务,主流热门基准大多无关紧要,Qwen 完全够用。作者以此质疑现有 benchmark 对真实工程工作的代表性,并询问其他人是否也有类似经历或退回大模型的体验。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →