作者称 AI 基准已失真

bindureddy · x · 2026-07-13

作者认为,**AI benchmarks 已经“完全坏掉”**:它们大多只测 **单轮首答**,而 LLM 又会针对这类题型做成本与性能优化,因此分数并不能代表真实能力。 他强调,真实世界更接近 **长上下文、多人回合、持续交互** 的场景,而现有基准很难反映模型在这类任务中的稳定性与实用性。

所属事件:AI 基准测试被指已失真,无法反映真实能力(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →