开发者直言模型基准已失真:无法反映真实一小时级长任务
pvncher · x · 2026-09-27
pvncher 炮轰当前模型基准测试「完全坏掉了」:这类基准把一堆微小任务孤立测试,根本不反映真实使用。他引用自己此前的观点指出,真实用户的 prompt 往往要跑一小时以上——模型需要解读含糊的指令、在混乱的代码库里导航、反复迭代直到满意,中间要经历多次上下文压缩和人工干预;而 deepswe 这类基准任务边界清晰,简单到推理成本只要 1.5 美元就能完成。他呼吁不要再过度信任这类基准。
「模型」频道最新
- ScienceArena 基准:模型做化学题遇结构图,得分掉近 10 个点 — geoffwolfe · 2026-09-27
- 自建写作基准:GLM-5.3 Flash 花 0.7 美分写出 1.7% 差距 — OnlyProggingForFun · 2026-09-27
- 从业者感叹:前沿智能已过剩便宜到用不满订阅额度 — intellectronica · 2026-09-27
- Karpathy:用 Claude Opus 4.5 学历史比读书更有留存 — doodlestein · 2026-09-27
- 自建写作基准:GLM-5.3 Flash 花 1/429 价格仅差 1.7 分 — OnlyProggingForFun · 2026-09-27
- ChatGPT-6 Astra 两天破解 1941 年恩尼格玛密文,自写模拟器 — luisdans · 2026-09-27