AI 基准测试被指已失真,无法反映真实能力

有观点指出,当前 AI 基准测试已"完全坏掉":大多数基准仅测单轮首答,而 LLM 会针对此类题型做成本与性能优化,导致分数无法代表真实能力。作者以 ImageNet 类比说明,早期基准虽有助起步,但范式改变后旧基准会变成误导,真正应关注的是真实任务中的整体价值。

2026-07-13 ~ 2026-07-13 · 2 条相关