企业级开发实测:主流基准跑分与真实任务严重错配
DivideHorror3217 · reddit · 2026-09-19
作者(数据分析背景、非职业开发者)用 AI 搭建了多用户数据管理平台,烧掉两个 200 美元账号后,让模型评估「同样的活能不能用 Opus 4.6 干完」。
模型一开始机械复读「27B 模型做不了」,完全无视 Opus 4.6 与 Qwen3.8 27B 基准成绩相近这一事实。换一种问法(「朋友说我用 Opus 5 / Sol 5.6 xhigh 是不是杀鸡用牛刀」)后,模型承认:对这类企业仓库式编码任务,主流热门基准大多无关紧要,Qwen 完全够用。作者以此质疑现有 benchmark 对真实工程工作的代表性,并询问其他人是否也有类似经历或退回大模型的体验。
「模型」频道最新
- TypeSafe 推出 Jev:不做文本生成、专为软件决策设计的模型 — _jaydeepkarale · 2026-09-19
- 实测称 Jev 处理 384 条新闻仅花 $0.19,比 Claude Opus 5 便宜约 390 倍 — airesearch12 · 2026-09-19
- Jev 开放权重并加入视觉能力,用 Gemma 4 26B-A4B 零标注分类 1697 场活动 — alexcovo_eth · 2026-09-19
- 网友称 DeepSeek Flash 便宜但 token 消耗大,性价比存疑 — oran_ge · 2026-09-19
- Vercel 网关开源模型 token 占比创纪录达 78.4% — charles_irl · 2026-09-19
- 用户抱怨 Cursor 频繁强制切到 Grok,考虑转投 Claude Code — gaganghotra_ · 2026-09-19