开发者直言模型基准已失真:无法反映真实一小时级长任务

pvncher · x · 2026-09-27

pvncher 炮轰当前模型基准测试「完全坏掉了」:这类基准把一堆微小任务孤立测试,根本不反映真实使用。他引用自己此前的观点指出,真实用户的 prompt 往往要跑一小时以上——模型需要解读含糊的指令、在混乱的代码库里导航、反复迭代直到满意,中间要经历多次上下文压缩和人工干预;而 deepswe 这类基准任务边界清晰,简单到推理成本只要 1.5 美元就能完成。他呼吁不要再过度信任这类基准。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →