AI 评测为何总用「一句话生成游戏」?社区反思测试脱离实际

ddeeppiixx · reddit · 2026-07-31

Reddit 网友发帖质疑当前 AI 模型的评测方式过于表面化。作者指出,无论是 YouTube 博主还是主流 Benchmark,大多依赖“做个网站”或“写个赛车游戏”这类简短的通用提示词,或者容易自动评分的选择题和短代码题。

这种评测难以反映真实工作场景中的复杂任务需求。作者认为目前只有 deepswe 等少数评测试图贴近真实工作流,呼吁业界采用包含详细、真实指令的复杂任务来衡量模型能力。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →