LlamaIndex基准评分有缺陷,修复后得分升至93.6%
VikParuchuri 发现 LlamaIndex 基准测试的评分逻辑存在缺陷:评分器会惩罚输出中的额外字段,但在计分前未先剥离元数据/置信度字段,导致 API 模型得分被系统性低估——修复该问题后,Datalab 的得分从 65% 跃升至 93.6%。他同时指出修复后 LlamaExtract Agentic Plus 仍居榜首,但领先原因存疑,并公开批评这类低级错误被包装进新闻稿与营销物料,呼吁业界自行运行评估。
已确认
- 评分缺陷机制:评估器在计算完美提取分数时会惩罚额外字段,却未先剥离输出中的元数据/置信度字段,API 得分因此被低估(修复前 API 65%,开源模型 77%)
- 修复评分缺陷后,Datalab 得分从 65% 升至 93.6%
- LlamaExtract Agentic Plus 在修复后的基准中仍排名第一
- VikParuchuri 明确表示不满:基准测试中的低级错误被用于新闻稿和营销宣传
尚未确认
- LlamaExtract Agentic Plus 领先的真实原因尚无定论。VikParuchuri 列出三种可能:确实擅长该文档类型、基准过拟合(厂商常在自家基准上领先)、或评分仍存在重大错误
为什么重要
- 该事件展示了供应商基准的脆弱性:榜单名次可能反映评分 bug 或过拟合,而非模型真实能力
- VikParuchuri 的建议具有普遍参考价值:使用者在选型时应自行运行评估,不要轻信供应商新闻稿中的基准数据
2026-08-15 ~ 2026-08-15 · 5 条相关
一手来源
- LlamaIndex基准评分有bug:修复后Datalab从65%升至93.6% — VikParuchuri ·
- 开源模型得分反超API?评估器未剥离元数据导致分数虚低 — VikParuchuri ·
- LlamaExtract Agentic Plus仍居榜首,但评测可能过拟合或存在错误 — VikParuchuri ·
- LlamaIndex基准测试存缺陷,修复后Datalab从65%升至93.6% — VikParuchuri · 2026-08-15
- 【源头】开源模型得分反超API?评估器未剥离元数据导致分数虚低 — VikParuchuri · 2026-08-15
- 【源头】LlamaExtract Agentic Plus仍居榜首,但评测可能过拟合或存在错误 — VikParuchuri · 2026-08-15
- VikParuchuri:基准测试低级错误被包装成新闻稿,应自行评估 — VikParuchuri · 2026-08-15
另有 1 条近重复转述:VikParuchuri