LlamaIndex CEO:对抗刷榜不是弃用基准,而是要更多更稳的基准
ajratner · x · 2026-09-08
LlamaIndex CEO Jerry Liu 在长文中给出关于 benchmark 的思维模型:
- 基准是高维能力空间中的「点测量」实验;基准天然有引力——一旦发布,其周边能力会因优化循环而提升。
- 坏结局是能力面极端尖锐化(overfitting / benchmaxxing):模型在某个工具上 demo 惊艳、通用场景拉胯。
- 好结局仍是参差不齐的,但相对平滑。
- 提升平滑度靠两点:让单个基准更鲁棒,以及持续产出更多、分布覆盖更广的基准。
他援引 Goodhart 定律:「任何成为目标的测量都会失效」——其本意不是停止测量,而是避免过于简单、易被 gaming 的单一指标。结论:基准要的是更多而非更少,以更大的鲁棒性、频率和分布覆盖来平滑 AI 的能力面。
所属事件:LlamaIndex CEO 论基准之道:持续维护胜过弃用(2 条相关)→
「研究」频道最新
- 作弊泛滥:现代 AI 基准测试成绩普遍不可信 — xeophon · 2026-09-08
- Looped Transformer 受热捧:Nanbeige4.2-3B 复现 3B 胜 12B 的 Agent 成绩 — alexcovo_eth · 2026-09-08
- 超10万女性乳腺癌筛查随机试验:医学AI评估转向患者结局 — EricTopol · 2026-09-08
- AI数学能力报道存在严重偏差:成功案例被追踪,失败无人记录 — RexDouglass · 2026-09-08
- 菲尔兹奖得主 Voevodsky 为何改用 Coq 验证全部证明 — RexDouglass · 2026-09-08
- PlaidQ 连续扩散 LM 蒸馏至单步,HumanEval 一步达 pass@1 7.07 — AlexanderTong7 · 2026-09-08