AI 评测为何总用「一句话生成游戏」?社区反思测试脱离实际
ddeeppiixx · reddit · 2026-07-31
Reddit 网友发帖质疑当前 AI 模型的评测方式过于表面化。作者指出,无论是 YouTube 博主还是主流 Benchmark,大多依赖“做个网站”或“写个赛车游戏”这类简短的通用提示词,或者容易自动评分的选择题和短代码题。
这种评测难以反映真实工作场景中的复杂任务需求。作者认为目前只有 deepswe 等少数评测试图贴近真实工作流,呼吁业界采用包含详细、真实指令的复杂任务来衡量模型能力。
「研究」频道最新
- Jonas Frey 等发布足式机器人新机遇综述 — ChongZzZhang · 2026-07-31
- AI 将数月数据分析缩至 1.5 小时,科研论文受众将转向 AI — nathanbenaich · 2026-07-31
- Cohere暑期学校分享:边缘智能体模型设计与后训练 — maximelabonne · 2026-07-31
- ICLR 2026论文:TTT3R提升3D重建模型长度泛化能力 — rsasaki0109 · 2026-07-31
- NTU 提出 Σ-Mem:为多智能体系统打造可靠性记忆 — NanyangTechnologicalUniversity · 2026-07-31
- 公平性剪枝:定位GLU-MLP层中的人口统计偏见 — Pere Martra · 2026-07-31