作者称 AI 基准已失真
bindureddy · x · 2026-07-13
作者认为,**AI benchmarks 已经“完全坏掉”**:它们大多只测 **单轮首答**,而 LLM 又会针对这类题型做成本与性能优化,因此分数并不能代表真实能力。 他强调,真实世界更接近 **长上下文、多人回合、持续交互** 的场景,而现有基准很难反映模型在这类任务中的稳定性与实用性。
所属事件:AI 基准测试被指已失真,无法反映真实能力(2 条相关)→
「研究」频道最新
- Gated Delta Networks 论文把 Mamba 思路推进到新架构 — vista8 · 2026-07-21
- Distilled RL 把教师监督融进 LLM 后训练,超过传统 RL 和蒸馏 — ZGCA · 2026-07-21
- ReflectWorld-MM 把视频记忆按实体组织,在 6 项基准上拿到最好成绩 — Xiaokang Ma · 2026-07-21
- HOMIE 用多模态对齐提升人-物视频个性化生成 — Yiyang Cai · 2026-07-21
- Stanford 和 Anthropic 用图记忆让 agent 代码准确率提升 36% — blaizedsouza · 2026-07-21
- BaoCut 集成 MOSS-Transcribe-Diarize-0.9B 做说话人转写 — dotey · 2026-07-21